企业动态

给 Flash 装上眼睛!Deepseek‑V4‑Flash‑Vision‑Exp 灵通云已上线

灵通云2026/08/28 14:12
给 Flash 装上眼睛!Deepseek‑V4‑Flash‑Vision‑Exp 灵通云已上线

8月21日,DeepSeek正式推出DS‑V4‑Flash‑Vision‑Exp多模态实验模型并同步开放API调用接口。该模型基于V4‑Flash架构扩展视觉能力,面向大批量图像解析、文档版式识别、图表理解、Agent视觉浏览场景做专项优化,主打低延迟、高并发推理能力,适配企业大规模OCR自动化、视觉问答业务。本次为实验版本,优先向企业开发者开放接入,官方将根据线上真实调用反馈持续迭代模型权重,补齐多模态Agent落地算力成本高的行业痛点。

灵通云已完成快速接入,纳入平台现有 100 + 大模型矩阵,登录灵通云平台即可一键调用。

https://tokens.lynxtoncloud.com/


模型定位:DeepSeek V4‑Flash 的实验性多模态版本(Exp=Experimental),文本能力继承 V4‑Flash,新增视觉理解能力,不牺牲原有推理、Agent 实力。

架构规格:MoE 架构,总参 284B,激活 13B 参数;上下文窗口1M tokens,最大输出支持 384K tokens,支持 Function‑call、结构化 JSON 输出,兼容主流 Agent 框架 API硅基流动。

核心特性:纯文本 Agent、推理、知识库能力与 V4‑Flash 正式版完全持平,视觉能力为增量升级;支持 URL、base64 图片输入,可解析截图、图表、流程图、报错界面,看懂图像后再执行工具调用、代码修复等动作;多模态 Agent 基准接近国际旗舰水平DeepSeek。


注意点:属于实验预览模型,模型能力、定价后续存在调整可能性;仅支持视觉理解,不具备图像生成能力。


最佳场景:多模态 Agent 原型验证、截图调试排错、图表数据提取、图文混合的复杂任务研发测试。


三大核心能力亮点

 视觉能力"零损耗"加装

在 V4-Flash 基座上以模块化方式扩展视觉模块,纯文本能力(Agent、推理、世界知识)与 V4-Flash 正式版完全持平甚至微升(Terminal Bench 2.1:83.9 vs 82.7;DeepSWE:59.3 vs 54.4)。多数模型加视觉会牺牲文本,它没有。

多模态 Agent 逼近 Opus-4.8,价格却只有零头

多模态 Agent 基准与 Opus-4.8 打成 2 胜 2 负(ApexBench 36.5 vs 39.4,Agents' Last Exam 27.3 vs 25.7 反超),但价格保持 V4-Flash 水平——输入约 0.22/输出0.22/输出0.66 每 1M tokens,对比 Opus 级 5/5/25,差一个数量级。且每张图片最多只按 384 tokens 计费。

1M 上下文 + 384K 最大输出 + 全生态兼容

支持 JSON Output、Tool Calls、Responses API 及 Anthropic API 格式;图片支持 Base64 / 外部 URL / Files API 三种传入方式;DeepSeek Harness 0.1.1 原生支持,Agent 工作流开箱即用。

一句话定位:它不是要超越旗舰,而是把"接近旗舰的多模态 Agent 能力"塞进了低成本、高吞吐的 Flash 产品线里——对原本就在用 DeepSeek API 的开发者,视觉能力几乎是零门槛、零加价接入。

典型应用场景

1.多模态 Agent 原型验证:依托Function-Call、兼容主流 Agent 框架 API,低成本快速验证图文智能体可行性。

2. 截图调试排错:依托视觉→行动闭环、URL/Base64 图片输入,看懂报错界面,直接定位并修复代码。

3. 图表数据提取:依托视觉解析、结构化 JSON 输出,图表/流程图转结构化数据。

4. 图文混合任务研发测试:依托1M 上下文、384K 输出,实验版低成本试错,安心跑实验。