【VLM-Agent】DeepSeek-V4-Flash-Vision-Exp

📅 2026/8/27 11:09:31
【VLM-Agent】DeepSeek-V4-Flash-Vision-Exp
noteDeepSeek-V4-Flash 原生“看图”能力 Tool Calling重点面向多模态 Agentex图片/截图 → V4 Flash Vision → 视觉理解 Reasoning → Function Call → 搜索/Crop/浏览器/代码等工具 → 最终回答多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台model‘deepseek-v4-flash-vision-exp’文章目录note一、DeepSeek-V4-Flash-Vision-ExpReference一、DeepSeek-V4-Flash-Vision-Exp1、视觉输入设计图片会根据尺寸转成视觉 token单张图片最多只占 384 tokens。大图会保持比例缩小到大约 800×800 像素量级再进入模型因此 2000×2000 和 5000×5000 的图最终视觉 token 上限一样。还可以设置detail“low”先缩到 512×512更快、更便宜detail“original/high”保留原始细节因为 Agent 可能一条轨迹里反复看截图、crop 图、搜索结果图。如果每张图都消耗几千 visual tokens成本很容易爆炸Reference[1] 官方接口文档https://api-docs.deepseek.com/guides/vision