2026年7月31日,DeepSeek正式上线 DeepSeek-V4-Flash-0731,并开启正式版API公测。

开发者无需更换接口地址,只需将模型名称设置为:
deepseek-v4-flash即可调用最新正式版本。
DeepSeek表示,此次更新重点提升Agent能力。在Terminal Bench 2.1、NL2Repo、CyberGym、DeepSWE和Toolathlon等测试中,V4-Flash正式版的成绩已经远超此前的V4-Pro预览版。模型还原生支持OpenAI Responses API格式,并针对Codex类编程Agent完成适配。
更值得关注的是,V4-Flash并没有扩大模型规模。
正式版与此前预览版保持相同结构,依旧采用约 2840亿总参数、130亿激活参数,此次提升主要来自重新进行的后训练,而不是通过增加参数换取成绩。
DeepSeek-V4-Flash正式版是什么?
DeepSeek-V4-Flash是DeepSeek V4系列中的高效率版本。
V4系列目前主要包括:
| 模型 | 总参数 | 激活参数 | 主要定位 |
|---|---|---|---|
| DeepSeek-V4-Flash | 2840亿 | 130亿 | 高并发、低成本、Agent应用 |
| DeepSeek-V4-Pro | 1.6万亿 | 490亿 | 复杂推理、世界知识和高难度任务 |
V4-Flash采用混合专家模型架构。虽然模型存储了2840亿参数,但处理每个Token时只激活其中约130亿参数,因此能够在保留较大知识和能力容量的同时,降低单次推理计算量。
需要说明的是,130亿是“每个Token参与计算的激活参数”,并不代表完整模型只有130亿参数,也不意味着官方完整权重可以像普通13B模型一样在消费级显卡上运行。
正式版没有增加参数,只重做后训练
DeepSeek官方明确表示:
DeepSeek-V4-Flash-0731的模型结构和尺寸与V4-Flash-Preview保持一致,仅重新进行了后训练。
这意味着本次更新没有改变:
- 总参数规模
- 激活参数规模
- 基础模型架构
- 100万Token上下文
- 核心注意力设计
主要变化发生在模型完成预训练之后的Agent强化和行为优化阶段。
后训练通常会影响模型在以下任务中的表现:
- 工具调用
- 终端操作
- 代码仓库理解
- 任务规划
- 错误恢复
- 多步骤执行
- 长任务目标保持
- 根据工具结果继续行动
相比单纯扩大模型规模,后训练更加直接地决定一个模型能否在Agent环境中稳定完成工作。
八项Agent测试成绩公布
DeepSeek公布了V4-Flash正式版的八项Agent测试成绩:
| 测试项目 | DeepSeek-V4-Flash-0731 |
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| CyberGym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon Verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench Public | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
DeepSeek将这些结果描述为“远超V4-Pro-Preview”。其中,DSBench-FullStack和DSBench-Hard属于DeepSeek内部使用的测试集,其余多项属于公开Agent及代码任务。
测试中的Code Agent任务使用了即将发布的 DeepSeek Harness极简模式,推理强度设置为max,同时采用top_p=0.95和temperature=1.0。
因此,比较不同模型成绩时,应同时关注:
- 使用的Agent框架
- 推理强度
- 工具权限
- 最大执行时间
- 测试重试次数
- 是否允许联网
- 是否使用专用Harness
同一个模型放在不同Agent框架中,最终任务完成率可能存在明显差异。
Terminal Bench 2.1达到82.7意味着什么?
Terminal Bench主要测试模型在终端环境中完成实际任务的能力。
这类任务通常需要模型:
- 阅读任务要求
- 检查文件和目录
- 执行Shell命令
- 安装或调用工具
- 修改文件
- 查看错误日志
- 调整实现方案
- 验证最终结果
它与普通代码问答的区别在于,模型不能只返回一段看起来正确的代码,而是需要在一个真实或模拟环境中完成任务。
V4-Flash在Terminal Bench 2.1获得82.7分,说明此次后训练明显加强了模型对终端工具、文件系统和长步骤执行流程的适应能力。该成绩来自DeepSeek官方测试配置,仍需结合完整评测记录和第三方复现判断稳定性。
NL2Repo测试代码仓库级交付
NL2Repo重点衡量模型将自然语言需求转换成代码仓库修改的能力。
真实软件开发任务通常不是生成一个孤立函数,而是需要模型:
- 理解项目目录
- 找到相关模块
- 判断应该修改哪些文件
- 保持现有接口兼容
- 补充测试
- 运行项目
- 修复新产生的问题
V4-Flash正式版在NL2Repo取得54.2分。
这类能力对以下应用尤为重要:
- AI编程Agent
- 自动修复Bug
- 需求转代码
- 跨文件重构
- 项目迁移
- 依赖升级
- 自动生成测试
DeepSWE达到54.4
DeepSWE属于软件工程Agent测试,要求模型在代码环境中持续分析、编辑和验证。
V4-Flash取得54.4分,说明它不再只是一个强调低价和响应速度的轻量模型,而是在尝试承担完整的软件工程任务。
不过,软件工程基准分数不能完全代表企业项目中的实际表现。
生产环境还会受到以下因素影响:
- 代码仓库规模
- 技术栈
- 测试覆盖率
- 项目文档质量
- 私有依赖
- 环境配置
- Agent工具链
- 任务描述是否明确
- 权限和安全限制
企业选型时,仍应使用自身代码库进行测试。
CyberGym与安全任务
V4-Flash在CyberGym中取得76.7分。
这类测试主要用于评估模型在隔离环境中的网络安全与系统任务处理能力,例如理解漏洞、分析程序行为和完成防御性安全任务。
相关能力可以应用于:
- 安全代码审查
- 漏洞定位
- 日志分析
- 配置风险检查
- 依赖安全扫描
- 自动化修复建议
企业在接入安全Agent时仍需设置严格沙箱、最小权限、审计记录和人工确认,不能让模型直接获得生产服务器的无限制操作权限。
Toolathlon测试多工具调用能力
Toolathlon Verified主要测试模型在复杂任务中选择和组合工具的能力。
Agent面对一个任务时,不只需要“会使用工具”,还要判断:
- 什么时候应该调用工具
- 应该选择哪个工具
- 参数应该如何填写
- 工具失败后如何处理
- 返回结果是否可信
- 是否需要继续调用其他工具
- 什么时候应该停止执行
V4-Flash正式版在Toolathlon Verified取得70.3分。
这对搜索Agent、办公Agent、数据分析Agent和企业自动化流程都有直接意义。
130亿激活参数为什么适合Agent?
Agent任务与普通聊天相比,往往具有三个特点:
调用次数更多
一次普通问答可能只调用模型一次。
一个完整Agent任务可能需要:
- 规划一次
- 搜索五次
- 读取十个文件
- 执行多条命令
- 修改多轮代码
- 验证多次结果
模型调用次数会快速增加。
上下文更长
Agent需要持续保存:
- 用户原始目标
- 任务计划
- 文件内容
- 工具输出
- 错误日志
- 历史修改
- 下一步决策
对成本更敏感
单次调用成本不高,但持续数十轮之后,总Token消耗可能明显增加。
V4-Flash每Token只激活130亿参数,并提供更低的API价格和更高并发限制,因此更适合高频、多步骤、长时间执行的Agent任务。
API价格只有V4-Pro的三分之一
DeepSeek当前公布的人民币API价格如下:
| 计费项目 | V4-Flash | V4-Pro |
| 输入缓存命中 | 0.02元/百万Token | 0.025元/百万Token |
| 输入缓存未命中 | 1元/百万Token | 3元/百万Token |
| 输出 | 2元/百万Token | 6元/百万Token |
| 并发限制 | 2500 | 500 |
在缓存未命中输入和输出价格上,V4-Flash均为V4-Pro的三分之一;并发限制则达到V4-Pro的5倍。
这对Agent应用尤其重要。
假设一个长任务消耗:
- 输入500万Token
- 输出100万Token
- 输入均未命中缓存
使用V4-Flash的参考费用为:
输入:5 × 1元 = 5元
输出:1 × 2元 = 2元
合计:7元使用V4-Pro的参考费用为:
输入:5 × 3元 = 15元
输出:1 × 6元 = 6元
合计:21元同等Token用量下,Flash可以将模型费用从21元降低至7元。
实际成本还会受到缓存命中率、输出长度、失败重试和未来峰谷定价影响。
DeepSeek即将采用峰谷定价
DeepSeek价格页面显示,API服务计划引入峰谷定价。
未来高峰时段价格将调整为常规价格的2倍,适用于全部计费项目。官方定义的北京时间高峰时段为:
- 每日9:00—12:00
- 每日14:00—18:00
截至2026年7月31日,具体生效日期仍待官方通知。
对于可以异步执行的Agent任务,开发者未来可以考虑:
- 将批量分析放到非高峰时段
- 缓存重复上下文
- 控制失败重试
- 复用搜索和工具结果
- 使用Flash处理常规任务
- 只将高难度任务升级至Pro
100万Token上下文与38.4万Token输出
V4-Flash和V4-Pro都支持:
- 100万Token上下文
- 最大38.4万Token输出
- 思考模式
- 非思考模式
- JSON Output
- Tool Calls
- 对话前缀续写
- FIM代码补全
100万Token上下文可以容纳:
- 大型代码仓库
- 多份研究报告
- 长篇合同
- 大量工具执行记录
- 多轮Agent任务历史
- 企业知识库资料
但窗口足够大不代表应该把所有内容都直接塞给模型。
更合理的Agent设计仍需要:
- 文件检索
- 上下文压缩
- 结果摘要
- 任务分段
- 缓存
- 重要状态持久化
- 无关内容清理
否则,长上下文会带来额外费用和信息噪声。
原生支持Responses API
V4-Flash正式版原生支持OpenAI Responses API格式。
开发者可以继续使用OpenAI Python SDK,只需要将API Key、Base URL和模型名称替换成DeepSeek配置:
from openai import OpenAI
client = OpenAI(
api_key="<你的 DeepSeek API Key>",
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="你是一名软件工程助手。",
input="检查当前项目的测试失败原因,并提出修复方案。",
)
print(response.output_text)DeepSeek当前只有V4-Flash支持Responses API;V4-Pro预计在2026年8月初加入支持。
支持哪些Responses API能力?
DeepSeek当前支持的主要Responses API能力包括:
modelinputinstructions- 流式输出
temperaturetop_pmax_output_tokens- Function工具
- Web Search工具
tool_choice- Reasoning Effort
- 结构化文本格式
- 并行工具调用
Reasoning Effort支持不同推理强度,可用于在速度、费用和复杂任务能力之间进行平衡。
DeepSeek提供给Codex的配置中列出了:
lowhighmax
三个推理档位,默认推荐使用high。
Responses API并非百分之百兼容
“支持Responses API”不意味着DeepSeek已经实现OpenAI接口的全部功能。
当前不支持或存在限制的功能包括:
previous_response_idconversation- 服务端
store backgroundmetadataincludeprompt- 自动截断
service_tier- 图片输入
- 文件输入
- 对话状态服务端保存
DeepSeek Responses API目前是无状态接口。开发者需要自行保存和回传历史消息,不能依赖previous_response_id自动延续对话。
部分不支持的参数会被静默忽略,而不是返回错误。因此,迁移已有应用后,需要检查每项功能是否真正生效。
当前只支持文本输入
尽管Responses API格式中可以包含图片和文件类型,DeepSeek V4-Flash当前仍只支持文本输入。
官方文档显示:
input_text支持output_text支持- 图片输入不支持
- 文件输入不支持
- 图片内容块可能被替换成占位文本
因此,V4-Flash更适合:
- 代码Agent
- 搜索Agent
- 文档Agent
- 数据分析Agent
- 终端Agent
- 结构化业务流程
需要视觉识别、截图分析和图片理解的Agent,需要额外接入视觉模型。
针对Codex完成适配
DeepSeek为Codex提供了专门的接入说明和一键配置脚本。
目前V4-Flash可以接入:
- Codex CLI
- ChatGPT桌面端中的Codex
- VS Code Codex插件
这些客户端共用~/.codex中的配置文件,完成一次配置后即可在不同Codex客户端中使用DeepSeek模型。
DeepSeek还为模型提供了:
- 100万上下文窗口声明
- 推理强度档位
- 工具调用格式
- Patch工具配置
- Web Search工具配置
- 并行工具调用支持
官方文档提供了一键配置脚本,但执行远程脚本前应先阅读脚本内容,并备份原有Codex配置。
可接入哪些Agent工具?
DeepSeek官方维护了Awesome DeepSeek Agent项目,已经提供或收录多种Agent工具的接入教程,包括:
- Codex
- Claude Code
- OpenCode
- OpenClaw
- Cline
- GitHub Copilot
- GitHub Copilot CLI
- Cherry Studio
- Kilo Code
- Oh My Pi
- DeepSeek-TUI
- Hermes
- LobeHub
这说明V4-Flash的产品方向并不局限于DeepSeek官网聊天,而是希望成为各类Agent和AI编程工具的底层模型。
V4-Flash是否全面超过V4-Pro?
目前不能这样下结论。
官方可以确认的是:
V4-Flash正式版在此次公布的Agent基准中远超V4-Pro预览版。
但这不等于:
- 世界知识全面超过V4-Pro
- 数学推理全面超过V4-Pro
- 所有代码任务都超过V4-Pro
- 长难任务稳定性一定更高
- 已经超过尚未发布的V4-Pro正式版
DeepSeek在V4预览版发布时表示,Flash的推理能力接近Pro,并且在简单Agent任务上与Pro表现相当;高难度任务上仍与Pro存在差距。
经过此次后训练后,Flash在Agent测试中取得明显提升,但V4-Pro正式版也尚未发布。
因此,更准确的描述是:
DeepSeek-V4-Flash-0731已经从“低价快速版”升级成了Agent专项能力很强的正式模型,但V4-Pro仍将承担更复杂的旗舰任务。
为什么Flash可能比更大的Pro更适合Agent?
Agent任务的最终效率由多个因素共同决定:
- 模型单次响应速度
- 工具选择准确率
- 每轮Token成本
- 并发限制
- 失败重试次数
- 任务完成率
- 思考Token长度
- 框架调度效率
更大的模型可能在单次复杂判断上更强,但如果调用速度较慢、价格较高,就不一定适合高频多轮任务。
V4-Flash的优势包括:
- 130亿激活参数
- 更低输入和输出价格
- 2500并发限制
- 100万Token上下文
- 三档推理强度
- Responses API
- Codex适配
- Tool Calls
- 服务端Web Search工具格式
这些能力使它更适合承担Agent系统中的大部分日常执行任务。
可以采用“Flash执行,Pro升级”策略
企业构建Agent时,可以使用模型路由方案。
V4-Flash处理
- 文件读取
- 常规代码修改
- 数据整理
- 搜索汇总
- 简单故障排查
- 普通工具调用
- 批量任务
- 高频自动化
V4-Pro处理
- 复杂架构设计
- 高难度代码问题
- 重要决策分析
- 多约束规划
- 高风险业务判断
- Flash连续失败的任务
这样的分层可以同时控制成本和任务质量。
不过,V4-Pro正式版尚未发布,最终路由策略需要等待新版本能力和价格确认。
正式版是否已经开放权重?
DeepSeek在2026年4月已经开放了V4系列预览版权重,官方Hugging Face合集包含V4-Flash、V4-Pro及相关基础模型。
但7月31日更新日志只明确说明:
- API升级为V4-Flash-0731
- 模型结构与尺寸不变
- 重新进行了后训练
- 只更新Flash API
- 网页端和App没有更新
截至2026年7月31日,官方Hugging Face合集尚未出现单独标记为DeepSeek-V4-Flash-0731的新权重。
因此,更严谨的表述是:
V4-Flash预览版权重已经开放,但0731正式版后训练权重目前尚未确认单独发布。
不能把本次API更新直接写成“V4-Flash-0731正式版同步开源”。
网页端和App没有更新
本次正式版仅升级DeepSeek-V4-Flash API。
DeepSeek官方特别说明:
- V4-Pro API没有变化
- DeepSeek网页端没有变化
- DeepSeek App没有变化
- V4-Pro正式版将尽快发布
普通用户在DeepSeek网页端使用时,不应默认认为自己已经切换到V4-Flash-0731。
目前最明确的使用方式是通过API调用deepseek-v4-flash。
旧模型名称已经停止推荐
DeepSeek此前使用:
deepseek-chatdeepseek-reasoner
两个API模型名称。
V4预览版上线后,这两个名称曾分别映射至V4-Flash的非思考和思考模式,并计划在2026年7月24日停止使用。
新应用应直接使用:
deepseek-v4-flash思考和非思考模式由请求参数控制,而不是通过两个不同模型名称区分。
DeepSeek-V4-Flash适合哪些场景?
AI编程Agent
可用于读取仓库、修改代码、运行终端和执行测试。
企业自动化Agent
适合调用内部接口、整理数据、生成报表和处理重复流程。
搜索与研究Agent
可以围绕任务多次搜索、阅读资料并生成带来源的总结。
数据分析Agent
适合处理CSV、数据库查询、清洗任务和结构化报告。
客服及业务Agent
可以结合Tool Calls查询订单、库存、物流和客户信息。
长程任务Agent
100万Token上下文可以保存更多任务状态、工具结果和历史记录。
高并发AI应用
2500并发限制及较低Token价格,适合需要同时处理大量请求的服务。
开发者接入时需要注意什么?
保存Agent历史状态
Responses API当前不支持previous_response_id和服务端Conversation,应用需要自行保存历史消息。
检查不支持的参数
部分参数会被静默忽略,迁移后应逐项测试。
不要提交图片和文件
当前V4-Flash只支持文本输入。
控制思考强度
简单任务使用low可以减少时间和Token,复杂任务再切换至high或max。
设置工具权限
文件删除、生产部署、支付和外部消息发送应保留人工确认。
注意未来峰谷价格
高峰时段价格计划提高至常规价格的2倍,但尚未正式生效。
使用自己的业务测试集
官方基准不能代替真实代码库、工作流和企业数据测试。
总结
DeepSeek-V4-Flash-0731正式版于2026年7月31日上线API公测。
模型继续采用2840亿总参数、130亿激活参数的MoE架构,结构和尺寸没有变化,本次主要通过重新后训练强化Agent能力。
官方公布的主要测试成绩包括:
- Terminal Bench 2.1:82.7
- NL2Repo:54.2
- CyberGym:76.7
- DeepSWE:54.4
- Toolathlon Verified:70.3
- Agent Last Exam:25.2
- Automation Bench Public:25.1
DeepSeek称,这些Agent成绩已经远超V4-Pro预览版。
V4-Flash还成为DeepSeek当前首个原生支持Responses API的模型,并针对Codex进行了专门适配。开发者可以使用OpenAI SDK和现有Agent接口迁移,但需要注意,该接口目前无状态、不支持图片与文件输入,也没有完整实现Responses API的全部参数。
价格方面,V4-Flash缓存未命中的输入价格为1元/百万Token,输出为2元/百万Token,均为V4-Pro的三分之一;并发上限为2500,是V4-Pro的5倍。
这使V4-Flash的定位发生了明显变化。
它不再只是V4系列中的便宜快速版本,而是成为DeepSeek面向代码Agent、搜索Agent、自动化流程和高并发企业应用的主力模型。
不过,本次仅更新API,网页和App没有切换至新版本,V4-Pro正式版也尚未发布。此前V4预览版权重已经开放,但V4-Flash-0731后训练版权重截至7月31日尚未确认单独放出。
真正值得观察的下一步,是DeepSeek即将发布的V4-Pro正式版,以及同样计划支持Responses API的Agent生态。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。