生命涌现的小龙虾技能之【Large Model Visual Question Answering Skill | 大模型视觉问答技能】简介

📅 2026/7/24 11:07:10
生命涌现的小龙虾技能之【Large Model Visual Question Answering Skill | 大模型视觉问答技能】简介
❓ Large Model Visual Question Answering Skill | 大模型视觉问答技能智能分析中枢· 图片/视频智能分析 · 结构化报告 · 历史报告云端查询 技能概览 | Overview模块内容️ 技能名称大模型视觉问答技能 核心目标大模型视觉问答VQA技能基于计算机视觉和大语言模型对图片内容进行开放式问答支持任意提问得到自然语言回答️ 输入类型图片、视频、本地文件、网络 URL 输出能力结构化分析报告、识别/监测结果、建议与报告链接 场景码VISUAL_QADeeply integrating Computer Vision (CV) and Large Language Model (LLM) technologies, this feature constructs anext-generation open-ended image question-answering system. Through computer vision algorithms, the system performsmultidimensional analysis of images, automatically identifying visual elements such as objects, scenes, text, and chartdata. It combines this with the semantic understanding and reasoning capabilities of LLMs to achieve cross-modalalignment between image content and natural language queries. Users can pose open-ended questions to any image (e.g., What is the core trend of this chart? or “Which period does the architectural style in the picture belong to?”).Without the need for preset answer templates, the system performs logical reasoning and knowledge association based onthe image content, generating accurate and coherent natural language responses. Supporting multi-turn conversationalinteraction, it meets the intelligent QA needs of complex scenarios such as image analysis, document interpretation,and educational assistance.本功能深度融合计算机视觉CV与大语言模型LLM技术构建了新一代开放式图片问答系统。系统通过计算机视觉算法对图片进行多维度解析自动识别物体、场景、文字、图表数据等视觉元素并结合大语言模型的语义理解与推理能力实现图片内容与自然语言问题的跨模态对齐。用户可对任意图片提出开放式问题如“这张图表的核心趋势是什么”“图片中的建筑风格属于哪个时期”系统无需预设答案模板即可基于图片内容进行逻辑推理与知识关联生成准确、连贯的自然语言回答支持多轮对话交互满足图像分析、文档解读、教育辅助等复杂场景下的智能问答需求 技能演示 | Skill Demo▶️ 点击查看技能使用介绍 任务目标 | Goals1. 技能用途通过图片结合用户问题进行大模型视觉问答获得自然语言回答2. ️ 能力范围序号具体能力1图片内容理解2开放式问答3场景描述4细节识别5知识推理3. ⚡ 触发条件触发类型触发规则✅ 默认触发默认触发当用户提供图片 URL 或文件并提出问题需要对图片进行问答时默认触发本技能 明确分析意图当用户明确需要进行视觉问答提及 VQA、看图问答、图片问答、视觉问答等关键词并且上传了图片 历史报告查询当用户提及以下关键词时自动触发历史问答记录查询功能查看历史问答记录、视觉问答历史、问答记录清单、查询历史问答显示所有问答记录触发规则 4用户提供图片后附带问题如这张图片里有什么直接触发视觉问答4. 自动行为自动行为执行要求 附件处理如果用户上传了附件或者视频/图片文件则自动保存为本地文件☁️ 历史报告查询如果用户触发历史报告查询关键词必须直接调用云端 API 查询不得从本地记忆或人工汇总中获取⚠️ 强制数据获取规则次高优先级橙色强约束历史报告清单只允许从云端接口读取不允许从本地记录、长期记忆或人工汇总中提取。必须执行python-mscripts.visual_qa_analysis--list类型要求✅ 必须使用python -m scripts.visual_qa_analysis --list调用 API 查询云端的历史报告数据 严格禁止从本地memory目录读取历史会话信息 严格禁止手动汇总本地记录中的报告 严格禁止从长期记忆中提取报告✅ 输出格式必须统一从云端接口获取最新完整数据然后以 Markdown 表格格式输出结果 前置准备 | Requirements依赖说明:scripts 脚本所需的依赖包及版本requests2.28.0 操作步骤 | Workflow 用户身份处理内部自动完成绿色安全原则用户身份参数由系统内部自动处理不得向用户展示、询问或要求输入任何身份标识。执行本技能分析或历史报告查询时脚本会自动完成身份初始化场景系统行为上游系统有内部身份参数由脚本静默接收并使用上游系统未提供内部身份参数脚本会自动复用本地缺省用户本地缺省用户不存在脚本会自动创建并在后续任务中复用对用户输出只展示分析进度、分析结果和报告链接不展示内部身份值 关键约束禁止/要求说明 不得询问身份不得提示用户输入用户名、手机号或任何内部身份参数 不得暴露身份值不得在回复、报告、示例、错误提示中暴露内部身份值 不得列为用户参数不得把内部身份参数列为用户需要理解或传入的参数✅ 自动关联报告历史报告查询同样由系统内部身份自动关联用户只需表达“查看历史报告/报告清单”等意图 标准流程 | Standard Flow步骤阶段执行动作1 准备图片输入提供本地文件路径或网络 URL确保输入内容清晰、符合技能场景要求2 系统自动完成身份关联无需用户输入任何身份参数不在回复中展示内部身份值3⚙️ 执行视觉问答调用-m scripts.visual_qa_analysis处理输入必须在技能根目录下运行脚本4 查看回答结果接收结构化分析报告查看识别/监测结果、风险提示、建议与报告链接⚙️ 脚本参数说明参数含义备注--input本地图片文件路径适用于本地文件分析--url网络图片 URL 地址API 服务自动下载API 服务自动下载网络资源--question用户提出的问题必填按需填写--list显示历史视觉问答列表清单用于云端历史报告查询--api-urlAPI 服务地址可选使用默认值按需填写--detail输出详细程度basic/standard/json默认 json输出详细程度--output结果输出文件路径可选可选️ 资源索引 | Resource Index资源类型路径用途何时读取 必要脚本scripts/visual_qa_analysis.py调用 API、执行分析或查询历史报告执行分析或查询时使用 必要脚本scripts/config.py调用 API、执行分析或查询历史报告执行分析或查询时使用 领域参考references/api_doc.md了解 API 接口规范、字段说明和错误码仅在需要了解接口规范或错误码时读取⚠️ 注意事项 | Notes分类注意事项 文档读取仅在需要时读取参考文档保持上下文简洁 格式支持支持格式图片支持 jpg/png/jpeg/webp 格式最大 20MB 脚本限制禁止临时生成脚本只能用技能本身的脚本 网络地址传入的网络地址参数不需要下载本地默认地址都是公网地址api 服务会自动下载‍⚖️ 结果性质本技能依赖大模型生成回答仅供参考重要信息请核实后再使用 格式支持当显示历史问答清单的时候从数据 json 中提取字段 作为超链接地址使用 Markdown 表格格式输出包含 报告输出表格输出示例 使用示例 | Examples# 本地图片问答python-mscripts.visual_qa_analysis--input/path/to/image.jpg--question这张图片里有什么内容请描述一下网络图片问答 python-mscripts.visual_qa_analysis--urlhttps://example.com/image.jpg--question图片中有几个人他们在做什么显示历史问答记录自动触发关键词查看历史问答、历史记录、问答清单等 python-mscripts.visual_qa_analysis--list# 输出精简回答python-mscripts.visual_qa_analysis--inputimage.jpg--question描述一下这张图片--detailbasic# 保存结果到文件python-mscripts.visual_qa_analysis--inputimage.jpg--question请识别图片中的文字内容--outputresult.json我们提供定制化AI技能开发服务。如果您有特定的业务需求可以联系我们的商务团队我们会为您量身打造专属的AI解决方案。