Aliyun Qwen VL
Aliyun Qwen VL 是开源项目 alicloud-skills 中的一个多模态视觉理解技能(Skill),把阿里云百炼(Model Studio)的通义千问视觉语言模型封装成可复用的 Agent 技能,面向图片问答、视觉分析、OCR 式信息提取、图表与表格读取、截图理解等场景。技能以标准 SKILL.md 结构发布,附带可直接调用的 Python 脚本、参数示例与参考文档,可被 Claude Code、OpenCode 等支持 Agent Skills 规范的工具一键安装调用。
核心功能
- 图片理解问答:输入图片 URL、本地路径或 data URL,用自然语言提问,模型返回对图片内容的理解与总结。
- 结构化信息提取:支持 JSON 模式与 JSON Schema 约束,可从发票、单据、图表等图片中按字段抽取信息,输出机器可读结果。
- 统一调用接口:提供 analyze_image.py 脚本与规范化 request/response 格式(prompt + image 进、text + usage 出),屏蔽 DashScope 兼容模式 API 细节。
- 多模型选择:默认使用 qwen3-vl-plus,可切换 qwen3-vl-flash 等更快更省的型号,也支持固定快照版本保证可复现性。
- 工程化细节:内置 429/5xx 指数退避重试、输出与证据文件落盘、图片压缩与大图处理建议等生产化约定。
特色优势
- 标准 Skill 规范:遵循 Anthropic Agent Skills 目录结构(SKILL.md + scripts + references),一条 npx 命令即可装入任意兼容 Agent。
- 开箱即用:只需设置 DASHSCOPE_API_KEY 即可运行,附带 Quickstart 命令、cURL 示例与冒烟测试脚本。
- 中文视觉场景友好:依托通义千问 VL 系列对中文文档、中文界面截图的识别能力,适合中文票据、报表与产品截图的理解任务。
- 可组合可扩展:与同仓库的 OCR、视频生成、云资源管理等技能并列,可组合构建完整的云上 AI Agent 工作流。
适用场景
- 需要让 AI 助手「看懂」截图、报表、票据、图表的个人与团队。
- 在 Agent 工作流中嵌入图像理解节点的开发者,如自动审核、单据录入、图表解读。
- 基于阿里云百炼构建多模态应用、希望复用标准化技能包的工程团队。