2026年7月31日,DeepSeek正式上线 DeepSeek-V4-Flash-0731,并开启正式版API公测。
新版本继续采用约2840亿总参数、130亿激活参数的混合专家架构,支持100万Token上下文、最长38.4万Token输出,以及思考模式、工具调用、JSON输出和代码补全等能力。

此次更新没有继续扩大参数规模,而是重新进行了后训练,重点提升代码Agent、终端操作、工具调用和复杂长程任务表现。DeepSeek公布的多项Agent成绩已经远超此前的V4-Pro预览版。(api-docs.deepseek.com)
价格仍然是V4-Flash最突出的优势。
DeepSeek官方API定价为:
- 缓存命中输入:0.02元/百万Token
- 缓存未命中输入:1元/百万Token
- 输出:2元/百万Token
相比OpenAI当前的GPT-5.6 Luna、Terra和Sol,DeepSeek-V4-Flash在输入和输出价格上均更低,尤其是输出Token成本差距非常明显。(api-docs.deepseek.com)
不过,“速度全面碾压GPT”需要拆开来看。
第三方测试显示,DeepSeek-V4-Flash的首Token响应速度较快,对GPT-5.6 Sol高推理档位也拥有明显的持续输出速度优势;但与强调速度的GPT-5.6 Luna相比,Luna生成后续Token的速度仍然更快。(artificialanalysis.ai)
因此,更准确的说法是:
DeepSeek-V4-Flash在API价格上全面低于GPT-5.6系列,在部分推理档位和响应指标上更快,但不能概括成所有速度指标都超过所有GPT模型。
DeepSeek-V4-Flash-0731是什么?
DeepSeek-V4-Flash-0731是DeepSeek V4系列的正式高效率版本。
它采用MoE混合专家架构:
| 项目 | DeepSeek-V4-Flash |
|---|---|
| 总参数规模 | 284B,约2840亿 |
| 激活参数规模 | 13B,约130亿 |
| 上下文窗口 | 1M Token |
| 最大输出 | 384K Token |
| 输入模态 | 文本 |
| 输出模态 | 文本 |
| 思考模式 | 支持 |
| 非思考模式 | 支持 |
| Responses API | 支持 |
| Anthropic API | 支持 |
| Tool Calls | 支持 |
| JSON Output | 支持 |
| FIM代码补全 | 非思考模式支持 |
| 当前API模型ID | deepseek-v4-flash |
V4-Flash拥有2840亿参数,但每次处理一个Token时只激活约130亿参数。这种稀疏设计能够在保持较大模型容量的同时,减少实际推理计算量。(api-docs.deepseek.com)
需要注意,130亿激活参数并不等于完整模型只有130亿参数。
如果企业自行部署,仍然需要存储和管理完整的2840亿参数权重,硬件门槛远高于普通13B模型。
正式版没有扩大模型,只重新做了后训练
DeepSeek官方明确表示,V4-Flash-0731与V4-Flash-Preview拥有相同的模型结构和参数规模,此次仅重新进行了后训练。(api-docs.deepseek.com)
这意味着此次能力提升主要来自:
- Agent任务训练
- 工具使用优化
- 终端环境操作
- 代码仓库级任务
- 长程规划
- 错误恢复
- 指令遵循
- 任务完成率优化
对于Agent模型而言,基础参数规模只是能力上限的一部分。
真正决定模型能否完成真实任务的,还包括:
- 是否会正确选择工具
- 能否理解工具返回结果
- 执行失败后能否调整方案
- 是否会陷入重复调用
- 能否保持原始任务目标
- 是否知道何时应该停止
- 最终结果能否通过验证
V4-Flash正式版的更新重点,正是这些生产环境中的执行能力。
DeepSeek V4-Flash API价格
DeepSeek官方当前定价如下:
| 计费项目 | V4-Flash | V4-Pro |
| 输入缓存命中 | 0.02元/百万Token | 0.025元/百万Token |
| 输入缓存未命中 | 1元/百万Token | 3元/百万Token |
| 输出 | 2元/百万Token | 6元/百万Token |
| 默认并发上限 | 2500 | 500 |
在缓存未命中输入和输出价格上,V4-Flash都是V4-Pro的三分之一。
并发上限则达到V4-Pro的5倍,更适合:
- 大规模客服
- 批量内容处理
- 代码Agent
- 搜索Agent
- 企业自动化
- 多用户AI应用
- 持续运行的长程任务
与GPT-5.6最新价格对比
OpenAI目前将GPT-5.6分为三个主要等级:
- GPT-5.6 Sol:旗舰能力
- GPT-5.6 Terra:中间档位
- GPT-5.6 Luna:速度和低成本档位
OpenAI在2026年7月30日更新价格后,当前官方API定价为:
| 模型 | 输入价格 | 输出价格 |
| DeepSeek V4-Flash | 约0.14美元/百万Token | 约0.28美元/百万Token |
| GPT-5.6 Luna | 0.20美元/百万Token | 1.20美元/百万Token |
| GPT-5.6 Terra | 2美元/百万Token | 12美元/百万Token |
| GPT-5.6 Sol | 5美元/百万Token | 30美元/百万Token |
DeepSeek美元价格采用Artificial Analysis根据DeepSeek官方人民币价格整理的参考值;人民币与美元的实际换算结果会随汇率变化。GPT-5.6价格来自OpenAI最新官方公告。(artificialanalysis.ai) (openai.com)
DeepSeek比GPT-5.6便宜多少?
按照当前参考价格计算:
对比GPT-5.6 Luna
- DeepSeek输入价格约低30%
- DeepSeek输出价格约低76.7%
- GPT-5.6 Luna输入约为DeepSeek的1.4倍
- GPT-5.6 Luna输出约为DeepSeek的4.3倍
对比GPT-5.6 Terra
- DeepSeek输入约便宜14.3倍
- DeepSeek输出约便宜42.9倍
对比GPT-5.6 Sol
- DeepSeek输入约便宜35.7倍
- DeepSeek输出约便宜107倍
这里比较的是每百万Token的固定单价,不代表完成同一个任务的最终费用一定保持同样倍数。
不同模型可能使用不同数量的:
- 思考Token
- 输出Token
- 工具调用
- 重试次数
- 上下文Token
- 缓存Token
真正的任务成本应该按照“完成一项任务需要多少总费用”计算,而不是只看单Token价格。
一个长程Agent任务能省多少钱?
假设一个Agent任务需要:
- 缓存未命中输入:500万Token
- 输出:100万Token
不考虑工具和搜索额外费用。
DeepSeek V4-Flash
输入:5 × 1元 = 5元
输出:1 × 2元 = 2元
总计:7元GPT-5.6 Luna
按0.20美元输入、1.20美元输出计算:
输入:5 × 0.20美元 = 1美元
输出:1 × 1.20美元 = 1.20美元
总计:2.20美元GPT-5.6 Terra
输入:5 × 2美元 = 10美元
输出:1 × 12美元 = 12美元
总计:22美元GPT-5.6 Sol
输入:5 × 5美元 = 25美元
输出:1 × 30美元 = 30美元
总计:55美元在大量输入和输出的Agent场景中,V4-Flash的价格优势会被进一步放大。
尤其是代码、搜索和办公Agent,一次用户任务可能包含几十次模型调用,单轮看起来不高的费用,会在工具循环中反复产生。
为什么Agent特别在意输出价格?
普通AI问答通常只输出几百个Token。
Agent任务可能需要模型持续输出:
- 思考过程
- 工具调用参数
- 代码修改
- Shell命令
- 搜索关键词
- 文件补丁
- 错误分析
- 最终报告
一次复杂任务可能产生数万甚至数十万输出Token。
GPT-5.6 Sol输出价格为每百万Token 30美元,而DeepSeek V4-Flash的参考输出价格约为0.28美元,相差超过100倍。(openai.com) (artificialanalysis.ai)
这意味着,在任务成功率接近的情况下,DeepSeek更适合:
- 允许模型多轮尝试
- 批量运行自动化任务
- 为每名用户提供独立Agent
- 执行长时间代码任务
- 处理高频企业工作流
- 建立低价AI SaaS产品
不过,如果更强模型能明显减少失败、重试和人工修改,单价更高的模型仍可能拥有更低的综合成本。
DeepSeek速度真的超过GPT吗?
“速度”至少包含三个不同指标:
1. 首Token时间
用户提交请求后,多久看到第一个输出Token。
2. 持续输出速度
模型开始回答后,每秒生成多少个Token。
3. 完整任务耗时
从用户提交任务到获得最终可用结果,总共花费多少时间。
一款模型可能启动很快,但后续输出速度一般;也可能思考较久,但开始输出后速度很快。
因此,只说“模型速度更快”并不足够。
DeepSeek与GPT-5.6 Sol速度对比
Artificial Analysis对DeepSeek V4-Flash-0731 Max与GPT-5.6 Sol High进行了直接测试。
| 指标 | DeepSeek V4-Flash Max | GPT-5.6 Sol High |
| 持续输出速度 | 约113 Token/s | 约59 Token/s |
| 首Token时间 | 约1.56秒 | 约9.77秒 |
| 上下文窗口 | 100万Token | 100万Token |
在这一组档位中,DeepSeek的输出速度接近GPT-5.6 Sol High的1.9倍,首Token等待时间也明显更短。(artificialanalysis.ai)
但GPT-5.6 Sol的定位是旗舰能力,而不是最低延迟模型。
OpenAI还提供Fast模式及Cerebras高速服务,GPT-5.6 Sol在特定高速基础设施上最高可达到约750 Token/s,但该服务最初只向部分客户开放,不能与普通标准API直接混为一谈。(openai.com)
DeepSeek与GPT-5.6 Terra速度接近
在DeepSeek V4-Flash Max与GPT-5.6 Terra High的对比中:
| 指标 | DeepSeek V4-Flash Max | GPT-5.6 Terra High |
| 持续输出速度 | 约113 Token/s | 约112 Token/s |
| 首Token时间 | 约1.56秒 | 约2.20秒 |
两款模型的持续输出速度基本接近,DeepSeek首Token时间更短。(artificialanalysis.ai)
因此,对比Terra高推理档位时,可以说DeepSeek整体响应更快,但不能说两者持续生成速度存在数量级差距。
GPT-5.6 Luna持续输出速度更快
GPT-5.6 Luna是GPT-5.6系列中强调速度和低成本的版本。
Artificial Analysis测试显示:
| 指标 | DeepSeek V4-Flash Max | GPT-5.6 Luna Max |
| 持续输出速度 | 约113 Token/s | 约176 Token/s |
| 首Token时间 | 约1.56秒 | 约128秒 |
| 上下文窗口 | 100万Token | 100万Token |
DeepSeek更早开始返回答案,但GPT-5.6 Luna一旦开始输出,持续生成速度更快。(artificialanalysis.ai)
在较低推理强度下,GPT-5.6 Luna的持续输出速度同样可达到约145 Token/s,高于DeepSeek V4-Flash Max的约113 Token/s。(artificialanalysis.ai)
所以,不能把“DeepSeek速度全面超过GPT”作为严谨结论。
更准确的说法是:
- DeepSeek对GPT-5.6 Sol高推理档位更快
- DeepSeek与GPT-5.6 Terra高推理档位接近
- DeepSeek首Token通常较快
- GPT-5.6 Luna的持续输出速度更高
- GPT-5.6 Sol高速服务仍可能远快于普通DeepSeek API
为什么DeepSeek能够做到低价和较高速度?
V4-Flash的主要效率来源包括以下几方面。
130亿激活参数
虽然模型总参数达到2840亿,但每个Token只激活约130亿参数,减少单次推理计算。(api-docs.deepseek.com)
MoE稀疏路由
不同Token只调用部分专家,使模型不需要每次运行全部参数。
面向Agent的后训练
正式版重新进行Agent后训练,目标不仅是提高回答质量,也包括提高工具调用和任务完成效率。(api-docs.deepseek.com)
上下文硬盘缓存
DeepSeek API会自动缓存重复的上下文前缀。缓存命中时,输入价格从1元/百万Token降至0.02元,相当于降低98%。(api-docs.deepseek.com)
更高并发
V4-Flash提供2500并发限制,可以让服务商同时处理更多请求。(api-docs.deepseek.com)
100万Token上下文适合长程Agent
V4-Flash支持100万Token上下文和最多38.4万Token输出。
它可以容纳:
- 大型代码仓库
- 多份企业文档
- 大量网页搜索结果
- 较长的Agent执行历史
- 终端日志
- API返回结果
- 多轮工具调用
- 长篇研究报告
但100万Token不代表应该一次提交所有文件。
合理的Agent系统仍需具备:
- 文件检索
- 上下文压缩
- 历史摘要
- 重复内容去除
- 缓存前缀保持
- 任务状态持久化
- 重要信息索引
否则,长上下文会增加费用、延迟和信息干扰。
原生支持Responses API
V4-Flash正式版原生支持OpenAI Responses API格式,并针对Codex完成适配。(api-docs.deepseek.com)
开发者可以继续使用OpenAI Python SDK:
from openai import OpenAI
client = OpenAI(
api_key="<你的 DeepSeek API Key>",
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="你是一名企业软件开发Agent。",
input="分析项目中的测试失败原因,并生成修复方案。",
)
print(response.output_text)这种兼容方式降低了从OpenAI接口迁移到DeepSeek的工作量。
通常只需要修改:
- API Key
- Base URL
- 模型名称
- 部分不兼容参数
Responses API支持哪些能力?
DeepSeek当前支持的主要Responses API能力包括:
- 流式输出
- Function Calling
- 服务端Web Search
apply_patch代码修改工具- Tool Choice
- Reasoning Effort
- 结构化文本输出
- 并行工具调用
- 思考内容输出
- Token用量统计
这些能力可以用于构建:
- Codex类代码Agent
- 搜索Agent
- 企业自动化
- 研究助手
- 数据分析Agent
- 内容生产工作流
- 工具编排系统
DeepSeek Responses API并非完整兼容OpenAI
DeepSeek实现了Responses API的核心格式,但并未支持OpenAI接口的所有能力。
当前不支持或存在限制的项目包括:
previous_response_id- 服务端Conversation
store- Background任务
- Metadata
- File Search
- Code Interpreter
- Computer Use
- MCP内置工具
- 图片输入
- 文件输入
- Prompt Cache Key
- Context Management
- Service Tier
DeepSeek当前的Responses API是无状态的。
开发者需要自己保存并回传:
- 历史消息
- 工具调用
- 工具结果
- 思考内容
- 任务状态
部分不支持的参数会被静默忽略,而不是直接报错。迁移后应逐项验证,不能只因为接口成功返回就认为全部功能已经生效。
DeepSeek目前不支持图片输入
V4-Flash当前是纯文本输入和文本输出模型。
Responses API中的图片或文件内容不会被正常理解,图片输入可能被替换成占位文本。(api-docs.deepseek.com)
这也是它与GPT-5.6的重要差别。
GPT-5.6支持视觉输入,并具备更完整的Responses API、计算机使用、程序化工具调用和多Agent能力。(openai.com)
因此,需要以下能力的应用不能只比较Token价格:
- 图片分析
- UI截图理解
- 图表识别
- 计算机操作
- 完整文件工具
- 多模态Agent
- OpenAI内置Code Interpreter
- 服务端长任务状态管理
正式版Agent成绩
DeepSeek公布的V4-Flash-0731主要Agent测试成绩包括:
| 测试项目 | 成绩 |
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| CyberGym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon Verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench Public | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
DeepSeek称,这些结果远超V4-Pro预览版。(api-docs.deepseek.com)
需要注意:
- 测试使用了DeepSeek Harness极简模式
- 推理强度设置为
max top_p=0.95temperature=1.0- DSBench属于DeepSeek内部测试集
不同Agent框架和参数会明显影响最终成绩,因此不能只比较裸模型名称。
DeepSeek是否在综合性能上超过GPT-5.6?
不能根据当前资料得出这一结论。
GPT-5.6 Sol仍然是面向高难度代码、知识工作、科学、网络安全和复杂Agent任务的旗舰模型。OpenAI公布的Artificial Analysis Intelligence Index成绩显示,GPT-5.6 Sol明显高于DeepSeek V4-Flash。(openai.com) (artificialanalysis.ai)
DeepSeek的主要优势是:
- 价格极低
- 首Token速度较快
- 100万Token上下文
- Agent专项能力较强
- 适配Codex
- 并发上限高
- API迁移成本低
GPT-5.6系列的主要优势是:
- 更强的综合能力上限
- 原生视觉输入
- 更完整的工具生态
- 计算机使用
- 多Agent协同
- 服务端对话状态
- 更成熟的Responses API
- Sol高速推理服务
- Luna更高持续输出速度
所以,DeepSeek并不是在所有能力上替代GPT,而是在价格与部分Agent场景中提供了非常有竞争力的选择。
对AI商业化意味着什么?
V4-Flash把百万Token输出价格压到2元人民币后,很多过去成本较高的产品开始具备更现实的商业模型。
低价AI客服
企业可以允许Agent读取更长的历史记录、调用更多工具,而不必过度限制每轮输出。
AI编程工具
代码Agent可以进行更多次测试、修复和重试,减少因Token预算过低而提前停止任务。
自动研究与内容生成
搜索Agent可以读取更多资料并输出更完整的研究报告。
企业流程自动化
模型可以持续调用CRM、ERP、数据库和内部接口,完成多步骤业务流程。
个人AI产品
个人开发者不需要预先投入较高模型费用,也能测试具备长上下文和Agent能力的产品。
批量内容处理
适合文档分类、数据提取、信息整理、翻译和批量改写。
低价不等于总成本一定最低
模型调用费用只是AI产品成本的一部分。
一个正式Agent系统还需要支付:
- 搜索API
- 浏览器环境
- 沙箱服务器
- 数据库存储
- 向量检索
- 文件解析
- 工具调用
- 任务队列
- 日志与监控
- 人工审核
- 失败重试
如果模型更容易出现:
- 工具调用失败
- 长任务绕路
- 代码无法运行
- 搜索结果误判
- 需要多轮重试
那么节省的Token费用可能被额外执行成本抵消。
企业应重点计算:
单次成功任务总成本
=
模型费用
+
工具费用
+
计算资源
+
失败重试
+
人工审核而不是只看每百万Token单价。
如何选择DeepSeek或GPT-5.6?
适合优先选择DeepSeek V4-Flash
- 成本敏感
- 主要处理中文和文本
- 需要100万Token上下文
- 高并发请求
- 代码和终端Agent
- 批量自动化
- 已有OpenAI兼容客户端
- 愿意自己管理会话状态
- 不依赖图片和计算机操作
适合选择GPT-5.6 Luna
- 需要较高持续输出速度
- 需要图片输入
- 希望使用OpenAI完整生态
- 任务复杂度中等
- 需要更成熟的Responses API
适合选择GPT-5.6 Terra
- 希望在能力、价格和速度之间平衡
- 需要多模态与完整工具能力
- 已经深度接入OpenAI平台
适合选择GPT-5.6 Sol
- 高难度专业任务
- 复杂软件工程
- 科学研究
- 网络安全
- 高价值企业决策
- 需要计算机使用和多Agent
- 任务成功率比模型单价更重要
推荐采用模型路由
实际产品不必只选择一个模型。
可以根据任务难度建立分层策略:
DeepSeek V4-Flash处理
- 普通问答
- 文档提取
- 批量分类
- 基础代码任务
- 搜索整理
- 常规Agent执行
GPT-5.6 Luna或Terra处理
- 图片理解
- 多模态办公
- 更高输出速度
- 需要OpenAI内置工具的任务
GPT-5.6 Sol处理
- Flash连续失败的任务
- 复杂工程问题
- 高风险专业分析
- 多Agent长程任务
- 高价值最终审核
这种路由可以减少模型费用,同时保留高难度任务的能力上限。
DeepSeek即将采用峰谷定价
DeepSeek官方价格页面显示,未来API将引入峰谷定价。
高峰时段价格将调整为普通价格的2倍,时间为北京时间:
- 每日9:00—12:00
- 每日14:00—18:00
具体生效时间尚未正式公布。(api-docs.deepseek.com)
价格生效后,V4-Flash高峰期可能变为:
- 缓存命中输入:0.04元/百万Token
- 缓存未命中输入:2元/百万Token
- 输出:4元/百万Token
即使按高峰价计算,其价格仍然明显低于GPT-5.6 Terra和Sol。
企业可以将不需要实时完成的任务安排到非高峰时段,例如:
- 批量报告
- 数据清洗
- 夜间代码检查
- 每日资讯整理
- 知识库更新
- 离线内容生成
接入前需要注意什么?
不要继续使用旧模型名
deepseek-chat和deepseek-reasoner已经停止推荐使用,新项目应直接使用:
deepseek-v4-flash自行保存Responses API状态
DeepSeek不支持previous_response_id,需要应用自行管理历史记录。
不要提交图片和文件
V4-Flash当前只能处理文本。
检查静默忽略的参数
部分OpenAI Responses API参数即使不支持,也不会报错。
限制Agent权限
文件删除、代码部署、付款和外部消息发送应保留人工确认。
测试实际业务成功率
不要只使用公开Benchmark,应使用自己的代码库、文档和工作流测试。
计算完整任务成本
同时记录模型Token、工具调用、重试和人工审核费用。
总结
DeepSeek-V4-Flash-0731已经正式上线API并开启公测。
模型保持2840亿总参数、130亿激活参数的MoE架构,支持100万Token上下文和最长38.4万Token输出。本次更新没有增加参数,而是通过重新后训练明显强化Agent、终端、代码仓库和工具调用能力。(api-docs.deepseek.com)
价格方面,DeepSeek V4-Flash官方定价为:
- 输入缓存命中:0.02元/百万Token
- 输入缓存未命中:1元/百万Token
- 输出:2元/百万Token
这一价格明显低于GPT-5.6 Luna、Terra和Sol,尤其是输出价格相比GPT-5.6 Sol低约99%。(api-docs.deepseek.com) (openai.com)
速度方面,DeepSeek V4-Flash在第三方测试中:
- 比GPT-5.6 Sol High输出更快
- 与GPT-5.6 Terra High基本接近
- 首Token时间通常较短
- 持续输出速度低于GPT-5.6 Luna
- 也低于GPT-5.6 Sol的特定高速服务
(artificialanalysis.ai) (artificialanalysis.ai)
因此,“价格全面低于GPT-5.6”有数据支持,但“速度全面碾压GPT”并不成立。
V4-Flash真正带来的变化,是让100万Token上下文、长程Agent和高频工具调用进入一个更低的价格区间。
对于主要处理文本、代码、搜索和企业自动化的开发者而言,它可能成为成本非常有竞争力的基础模型;对于图片理解、计算机操作、多Agent和高难度专业任务,GPT-5.6系列仍然拥有更完整的能力与生态。
AI商业化的门槛确实在下降,但未来真正决定产品竞争力的,不只是每百万Token多少钱,而是:
用多少成本,能够稳定完成多少真实任务。








评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。