视频出海不用再来回切工具了:讯飞译制一站搞定字幕、翻译和AI配音(副本)
DeepSeek 终于开始认真补:
视觉能力。
继 8 月 21 日上线 API 后,DeepSeek 现在正式开放:

DeepSeek-V4-Flash-Vision-Exp
模型权重。
这是:
DeepSeek V4 系列首个实验性多模态模型。
总参数达到:
305B,也就是3050亿参数。
最关键的是,它并没有为了增加视觉能力,把原来的文本、Coding 和 Agent 能力砍掉。
官方给出的定位非常明确:
文本能力基本保持 V4-Flash 水平,同时加入视觉理解,让 Agent 真正开始“看着屏幕干活”。
一、不是生图模型,而是给 Agent 装“眼睛”
这里很容易误会。
DeepSeek-V4-Flash-Vision-Exp 并不是:
Midjourney;
Seedream;
GPT Image
这种图像生成模型。
它主要负责:
看图和理解图。
目前可以处理:
图片内容理解;
截图 OCR;
图表分析;
界面理解;
视觉问答;
图片 + 文本联合推理。
所以它真正适合的场景是:
看到网页
↓
理解界面
↓
分析问题
↓
调用工具
↓
继续执行任务这也是为什么 DeepSeek 更强调:
Multimodal Agent。
而不是单纯的 Vision Chat。
二、305B 参数,直接从 V4-Flash 长出了视觉能力
DeepSeek-V4-Flash-Vision-Exp 建立在:
DeepSeek-V4-Flash
架构之上。
在原来的语言模型基础上加入:
Vision Encoder;
Aligner;
视觉相关训练。
同时继续保留:
DFlash Attention;
MoE;
Hyper-Connections;
DSpark
等 V4 系列架构。
可以理解成:
原来的 V4-Flash 大脑没换,现在给它加了一双眼睛。
这样做最大的好处,就是已经训练好的:
Coding;
Agent;
推理;
世界知识
可以继续保留。
三、纯文本能力基本没掉
很多多模态模型都会遇到一个问题:
视觉加强以后,
文本能力反而掉了。
DeepSeek 这次特别强调:
Vision-Exp 的纯文本 Agent 能力和 V4-Flash 基本保持同一水平。
例如:
Terminal Bench 2.1:
83.9
V4-Flash:
82.7
DeepSWE:
59.3
V4-Flash:
54.4
Toolathlon-Verified:
75.9
V4-Flash:
70.3
也就是说:
加上视觉之后,它依然可以继续承担:
Coding Agent;
终端任务;
工具调用;
软件工程。
四、多模态 Agent 已经开始接近 Opus 4.8
真正值得看的还是视觉 Agent Benchmark。
目前官方数据中:
ApexBench
DeepSeek Vision:
36.5
Opus 4.8:
39.4
Agents' Last Exam
DeepSeek Vision:
27.3
Opus 4.8:
25.7
Chartography
DeepSeek Vision:
64.3
Opus 4.8:
65.0
ZeroBench
DeepSeek Vision:
35.0
Opus 4.8:
34.0
所以更准确的说法是:
DeepSeek-V4-Flash-Vision-Exp 的多模态 Agent 整体已经接近 Opus 4.8,并在部分测试上实现反超。
对于一个实验版开源模型来说,这个表现已经很猛了。
五、1M上下文 + 384K最大输出
API 版本还保留了 V4 系列的大上下文能力。
支持:
1M Token Context
最大输出:
384K Token。
这对于多模态 Agent 特别有价值。
因为一个复杂任务很可能同时包含:
代码;
几十张截图;
文档;
网页;
工具结果;
历史执行记录。
比如:
看这几个后台页面截图,对照代码仓库找出 UI 不一致的位置,然后直接修改前端代码并验证。
这已经同时需要:
视觉 + Coding + 长上下文 + Agent。
也是 DeepSeek 这次最想补齐的一块能力。
六、以后 Coding Agent 可以真正“看页面改代码”
这一点我觉得特别适合 Vibe Coding。
以前 Agent 修改前端:
主要靠代码猜。
它知道 CSS。
知道 React。
但不一定真正知道页面最后渲染成什么样。
有视觉能力以后,工作流可以进一步变成:
写前端
↓
打开页面
↓
读取截图
↓
发现按钮错位
↓
修改CSS
↓
重新截图
↓
再次检查也就是说:
视觉开始进入 Coding Loop。
以后让 DeepSeek 做:
网页;
Dashboard;
数据可视化;
浏览器自动化;
电脑操作
都会更加有意义。
七、图表分析也是非常实用的一块
视觉能力还有一个办公场景很容易被忽略:
图表。
例如直接扔一张:
销售趋势图;
财务报表截图;
Dashboard;
科研图表。
然后问:
哪个季度变化最大?结合图里的数据解释原因。
普通 OCR 只能:
把文字读出来。
多模态模型还需要理解:
坐标;
曲线;
颜色;
图例;
趋势;
空间关系。
DeepSeek 官方的 Chartography 已经做到:
64.3
和 Opus 4.8 的:
65.0
非常接近。
对于办公 Agent、科研 Agent 来说,会比较实用。
八、价格也直接沿用 V4-Flash
这次视觉能力并没有单独设置一套高价。
Vision-Exp API 直接沿用:
DeepSeek V4-Flash 价格。
国内当前高峰期:
缓存命中输入:
0.10 元 / 百万 Token
缓存未命中:
3 元 / 百万 Token
输出:
9 元 / 百万 Token
空闲时段全部:
半价。
图片则会先转换成输入 Token 计费。
单张图片最多计:
384 Token。
这意味着图片理解成本其实非常低。
如果大量 Agent 需要反复看截图、图表,这种价格会非常有竞争力。
九、这次是真的开源,MIT许可证
相比只开放 API,更值得开发者关注的是:
权重已经放出来了。
官方 Hugging Face 模型规模:
305B Parameters。
许可证:
MIT License。
同时已经提供最小 PyTorch 推理实现,并覆盖:
视觉编码;
Aligner;
DFlash;
MoE;
Hyper-Connections;
DSpark
等核心模块。
也可以结合:
vLLM;
SGLang
等推理框架进一步部署。
对于研究多模态 Agent、Coding Agent 和私有化部署的开发者来说,比只提供在线 API 更有价值。
十、这可能只是 DeepSeek 多模态路线的开始
模型名字里还有两个很重要的词:
Vision
以及:
Exp。
也就是:
实验版。
说明 DeepSeek 现在明显是在先验证:
V4 架构加视觉后,
到底能不能把:
文本 Agent;
视觉理解;
工具调用
稳定地融合在一起。
如果这条路线跑通,后面的 V4 正式多模态版本,大概率还会继续提升:
UI理解;
Computer Use;
视频理解;
视觉Agent;
复杂文档。
所以这次真正值得关注的不是:
DeepSeek终于会看图片了。
而是:
DeepSeek开始给Agent补眼睛了。
结语
DeepSeek-V4-Flash-Vision-Exp 这次可以记住几个关键词:
305B参数。
V4系列首个实验性多模态模型。
1M上下文。
384K最大输出。
MIT开源。
以及:
多模态Agent能力接近Opus 4.8。
它并没有走:
“单独做一个很会看图片的视觉模型”
这条路线。
而是把视觉直接加进现有:
Coding + Reasoning + Agent
能力里面。
这会带来一个非常有意思的变化:
以前 Agent 只能:
读代码、读文字。
以后它开始可以:
看网页、看截图、看图表,再继续调用工具把任务做完。
对 DeepSeek 来说,这可能比做一个普通的“看图聊天模型”重要得多。
因为真正进入 Agent 时代以后:
模型不只需要一颗大脑。
还得:
看得见。






评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。