2026年7月31日,DeepSeek正式上线 DeepSeek-V4-Flash-0731,并开启正式版API公测。

新版本继续采用约2840亿总参数、130亿激活参数的混合专家架构,支持100万Token上下文、最长38.4万Token输出,以及思考模式、工具调用、JSON输出和代码补全等能力。

image.png

此次更新没有继续扩大参数规模,而是重新进行了后训练,重点提升代码Agent、终端操作、工具调用和复杂长程任务表现。DeepSeek公布的多项Agent成绩已经远超此前的V4-Pro预览版。(api-docs.deepseek.com)

价格仍然是V4-Flash最突出的优势。

DeepSeek官方API定价为:

  • 缓存命中输入:0.02元/百万Token
  • 缓存未命中输入:1元/百万Token
  • 输出:2元/百万Token

相比OpenAI当前的GPT-5.6 Luna、Terra和Sol,DeepSeek-V4-Flash在输入和输出价格上均更低,尤其是输出Token成本差距非常明显。(api-docs.deepseek.com)

不过,“速度全面碾压GPT”需要拆开来看。

第三方测试显示,DeepSeek-V4-Flash的首Token响应速度较快,对GPT-5.6 Sol高推理档位也拥有明显的持续输出速度优势;但与强调速度的GPT-5.6 Luna相比,Luna生成后续Token的速度仍然更快。(artificialanalysis.ai)

因此,更准确的说法是:

DeepSeek-V4-Flash在API价格上全面低于GPT-5.6系列,在部分推理档位和响应指标上更快,但不能概括成所有速度指标都超过所有GPT模型。

DeepSeek-V4-Flash-0731是什么?

DeepSeek-V4-Flash-0731是DeepSeek V4系列的正式高效率版本。

它采用MoE混合专家架构:

项目DeepSeek-V4-Flash
总参数规模284B,约2840亿
激活参数规模13B,约130亿
上下文窗口1M Token
最大输出384K Token
输入模态文本
输出模态文本
思考模式支持
非思考模式支持
Responses API支持
Anthropic API支持
Tool Calls支持
JSON Output支持
FIM代码补全非思考模式支持
当前API模型IDdeepseek-v4-flash

V4-Flash拥有2840亿参数,但每次处理一个Token时只激活约130亿参数。这种稀疏设计能够在保持较大模型容量的同时,减少实际推理计算量。(api-docs.deepseek.com)

需要注意,130亿激活参数并不等于完整模型只有130亿参数。

如果企业自行部署,仍然需要存储和管理完整的2840亿参数权重,硬件门槛远高于普通13B模型。

正式版没有扩大模型,只重新做了后训练

DeepSeek官方明确表示,V4-Flash-0731与V4-Flash-Preview拥有相同的模型结构和参数规模,此次仅重新进行了后训练。(api-docs.deepseek.com)

这意味着此次能力提升主要来自:

  • Agent任务训练
  • 工具使用优化
  • 终端环境操作
  • 代码仓库级任务
  • 长程规划
  • 错误恢复
  • 指令遵循
  • 任务完成率优化

对于Agent模型而言,基础参数规模只是能力上限的一部分。

真正决定模型能否完成真实任务的,还包括:

  • 是否会正确选择工具
  • 能否理解工具返回结果
  • 执行失败后能否调整方案
  • 是否会陷入重复调用
  • 能否保持原始任务目标
  • 是否知道何时应该停止
  • 最终结果能否通过验证

V4-Flash正式版的更新重点,正是这些生产环境中的执行能力。

DeepSeek V4-Flash API价格

DeepSeek官方当前定价如下:

计费项目V4-FlashV4-Pro
输入缓存命中0.02元/百万Token0.025元/百万Token
输入缓存未命中1元/百万Token3元/百万Token
输出2元/百万Token6元/百万Token
默认并发上限2500500

(api-docs.deepseek.com)

在缓存未命中输入和输出价格上,V4-Flash都是V4-Pro的三分之一。

并发上限则达到V4-Pro的5倍,更适合:

  • 大规模客服
  • 批量内容处理
  • 代码Agent
  • 搜索Agent
  • 企业自动化
  • 多用户AI应用
  • 持续运行的长程任务

与GPT-5.6最新价格对比

OpenAI目前将GPT-5.6分为三个主要等级:

  • GPT-5.6 Sol:旗舰能力
  • GPT-5.6 Terra:中间档位
  • GPT-5.6 Luna:速度和低成本档位

OpenAI在2026年7月30日更新价格后,当前官方API定价为:

模型输入价格输出价格
DeepSeek V4-Flash约0.14美元/百万Token约0.28美元/百万Token
GPT-5.6 Luna0.20美元/百万Token1.20美元/百万Token
GPT-5.6 Terra2美元/百万Token12美元/百万Token
GPT-5.6 Sol5美元/百万Token30美元/百万Token

DeepSeek美元价格采用Artificial Analysis根据DeepSeek官方人民币价格整理的参考值;人民币与美元的实际换算结果会随汇率变化。GPT-5.6价格来自OpenAI最新官方公告。(artificialanalysis.ai) (openai.com)

DeepSeek比GPT-5.6便宜多少?

按照当前参考价格计算:

对比GPT-5.6 Luna

  • DeepSeek输入价格约低30%
  • DeepSeek输出价格约低76.7%
  • GPT-5.6 Luna输入约为DeepSeek的1.4倍
  • GPT-5.6 Luna输出约为DeepSeek的4.3倍

对比GPT-5.6 Terra

  • DeepSeek输入约便宜14.3倍
  • DeepSeek输出约便宜42.9倍

对比GPT-5.6 Sol

  • DeepSeek输入约便宜35.7倍
  • DeepSeek输出约便宜107倍

这里比较的是每百万Token的固定单价,不代表完成同一个任务的最终费用一定保持同样倍数。

不同模型可能使用不同数量的:

  • 思考Token
  • 输出Token
  • 工具调用
  • 重试次数
  • 上下文Token
  • 缓存Token

真正的任务成本应该按照“完成一项任务需要多少总费用”计算,而不是只看单Token价格。

一个长程Agent任务能省多少钱?

假设一个Agent任务需要:

  • 缓存未命中输入:500万Token
  • 输出:100万Token

不考虑工具和搜索额外费用。

DeepSeek V4-Flash

输入:5 × 1元 = 5元
输出:1 × 2元 = 2元
总计:7元

GPT-5.6 Luna

按0.20美元输入、1.20美元输出计算:

输入:5 × 0.20美元 = 1美元
输出:1 × 1.20美元 = 1.20美元
总计:2.20美元

GPT-5.6 Terra

输入:5 × 2美元 = 10美元
输出:1 × 12美元 = 12美元
总计:22美元

GPT-5.6 Sol

输入:5 × 5美元 = 25美元
输出:1 × 30美元 = 30美元
总计:55美元

在大量输入和输出的Agent场景中,V4-Flash的价格优势会被进一步放大。

尤其是代码、搜索和办公Agent,一次用户任务可能包含几十次模型调用,单轮看起来不高的费用,会在工具循环中反复产生。

为什么Agent特别在意输出价格?

普通AI问答通常只输出几百个Token。

Agent任务可能需要模型持续输出:

  • 思考过程
  • 工具调用参数
  • 代码修改
  • Shell命令
  • 搜索关键词
  • 文件补丁
  • 错误分析
  • 最终报告

一次复杂任务可能产生数万甚至数十万输出Token。

GPT-5.6 Sol输出价格为每百万Token 30美元,而DeepSeek V4-Flash的参考输出价格约为0.28美元,相差超过100倍。(openai.com) (artificialanalysis.ai)

这意味着,在任务成功率接近的情况下,DeepSeek更适合:

  • 允许模型多轮尝试
  • 批量运行自动化任务
  • 为每名用户提供独立Agent
  • 执行长时间代码任务
  • 处理高频企业工作流
  • 建立低价AI SaaS产品

不过,如果更强模型能明显减少失败、重试和人工修改,单价更高的模型仍可能拥有更低的综合成本。

DeepSeek速度真的超过GPT吗?

“速度”至少包含三个不同指标:

1. 首Token时间

用户提交请求后,多久看到第一个输出Token。

2. 持续输出速度

模型开始回答后,每秒生成多少个Token。

3. 完整任务耗时

从用户提交任务到获得最终可用结果,总共花费多少时间。

一款模型可能启动很快,但后续输出速度一般;也可能思考较久,但开始输出后速度很快。

因此,只说“模型速度更快”并不足够。

DeepSeek与GPT-5.6 Sol速度对比

Artificial Analysis对DeepSeek V4-Flash-0731 Max与GPT-5.6 Sol High进行了直接测试。

指标DeepSeek V4-Flash MaxGPT-5.6 Sol High
持续输出速度约113 Token/s约59 Token/s
首Token时间约1.56秒约9.77秒
上下文窗口100万Token100万Token

在这一组档位中,DeepSeek的输出速度接近GPT-5.6 Sol High的1.9倍,首Token等待时间也明显更短。(artificialanalysis.ai)

但GPT-5.6 Sol的定位是旗舰能力,而不是最低延迟模型。

OpenAI还提供Fast模式及Cerebras高速服务,GPT-5.6 Sol在特定高速基础设施上最高可达到约750 Token/s,但该服务最初只向部分客户开放,不能与普通标准API直接混为一谈。(openai.com)

DeepSeek与GPT-5.6 Terra速度接近

在DeepSeek V4-Flash Max与GPT-5.6 Terra High的对比中:

指标DeepSeek V4-Flash MaxGPT-5.6 Terra High
持续输出速度约113 Token/s约112 Token/s
首Token时间约1.56秒约2.20秒

两款模型的持续输出速度基本接近,DeepSeek首Token时间更短。(artificialanalysis.ai)

因此,对比Terra高推理档位时,可以说DeepSeek整体响应更快,但不能说两者持续生成速度存在数量级差距。

GPT-5.6 Luna持续输出速度更快

GPT-5.6 Luna是GPT-5.6系列中强调速度和低成本的版本。

Artificial Analysis测试显示:

指标DeepSeek V4-Flash MaxGPT-5.6 Luna Max
持续输出速度约113 Token/s约176 Token/s
首Token时间约1.56秒约128秒
上下文窗口100万Token100万Token

DeepSeek更早开始返回答案,但GPT-5.6 Luna一旦开始输出,持续生成速度更快。(artificialanalysis.ai)

在较低推理强度下,GPT-5.6 Luna的持续输出速度同样可达到约145 Token/s,高于DeepSeek V4-Flash Max的约113 Token/s。(artificialanalysis.ai)

所以,不能把“DeepSeek速度全面超过GPT”作为严谨结论。

更准确的说法是:

  • DeepSeek对GPT-5.6 Sol高推理档位更快
  • DeepSeek与GPT-5.6 Terra高推理档位接近
  • DeepSeek首Token通常较快
  • GPT-5.6 Luna的持续输出速度更高
  • GPT-5.6 Sol高速服务仍可能远快于普通DeepSeek API

为什么DeepSeek能够做到低价和较高速度?

V4-Flash的主要效率来源包括以下几方面。

130亿激活参数

虽然模型总参数达到2840亿,但每个Token只激活约130亿参数,减少单次推理计算。(api-docs.deepseek.com)

MoE稀疏路由

不同Token只调用部分专家,使模型不需要每次运行全部参数。

面向Agent的后训练

正式版重新进行Agent后训练,目标不仅是提高回答质量,也包括提高工具调用和任务完成效率。(api-docs.deepseek.com)

上下文硬盘缓存

DeepSeek API会自动缓存重复的上下文前缀。缓存命中时,输入价格从1元/百万Token降至0.02元,相当于降低98%。(api-docs.deepseek.com)

更高并发

V4-Flash提供2500并发限制,可以让服务商同时处理更多请求。(api-docs.deepseek.com)

100万Token上下文适合长程Agent

V4-Flash支持100万Token上下文和最多38.4万Token输出。

它可以容纳:

  • 大型代码仓库
  • 多份企业文档
  • 大量网页搜索结果
  • 较长的Agent执行历史
  • 终端日志
  • API返回结果
  • 多轮工具调用
  • 长篇研究报告

(api-docs.deepseek.com)

但100万Token不代表应该一次提交所有文件。

合理的Agent系统仍需具备:

  • 文件检索
  • 上下文压缩
  • 历史摘要
  • 重复内容去除
  • 缓存前缀保持
  • 任务状态持久化
  • 重要信息索引

否则,长上下文会增加费用、延迟和信息干扰。

原生支持Responses API

V4-Flash正式版原生支持OpenAI Responses API格式,并针对Codex完成适配。(api-docs.deepseek.com)

开发者可以继续使用OpenAI Python SDK:

from openai import OpenAI

client = OpenAI(
    api_key="<你的 DeepSeek API Key>",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="你是一名企业软件开发Agent。",
    input="分析项目中的测试失败原因,并生成修复方案。",
)

print(response.output_text)

这种兼容方式降低了从OpenAI接口迁移到DeepSeek的工作量。

通常只需要修改:

  • API Key
  • Base URL
  • 模型名称
  • 部分不兼容参数

Responses API支持哪些能力?

DeepSeek当前支持的主要Responses API能力包括:

  • 流式输出
  • Function Calling
  • 服务端Web Search
  • apply_patch代码修改工具
  • Tool Choice
  • Reasoning Effort
  • 结构化文本输出
  • 并行工具调用
  • 思考内容输出
  • Token用量统计

(api-docs.deepseek.com)

这些能力可以用于构建:

  • Codex类代码Agent
  • 搜索Agent
  • 企业自动化
  • 研究助手
  • 数据分析Agent
  • 内容生产工作流
  • 工具编排系统

DeepSeek Responses API并非完整兼容OpenAI

DeepSeek实现了Responses API的核心格式,但并未支持OpenAI接口的所有能力。

当前不支持或存在限制的项目包括:

  • previous_response_id
  • 服务端Conversation
  • store
  • Background任务
  • Metadata
  • File Search
  • Code Interpreter
  • Computer Use
  • MCP内置工具
  • 图片输入
  • 文件输入
  • Prompt Cache Key
  • Context Management
  • Service Tier

(api-docs.deepseek.com)

DeepSeek当前的Responses API是无状态的。

开发者需要自己保存并回传:

  • 历史消息
  • 工具调用
  • 工具结果
  • 思考内容
  • 任务状态

部分不支持的参数会被静默忽略,而不是直接报错。迁移后应逐项验证,不能只因为接口成功返回就认为全部功能已经生效。

DeepSeek目前不支持图片输入

V4-Flash当前是纯文本输入和文本输出模型。

Responses API中的图片或文件内容不会被正常理解,图片输入可能被替换成占位文本。(api-docs.deepseek.com)

这也是它与GPT-5.6的重要差别。

GPT-5.6支持视觉输入,并具备更完整的Responses API、计算机使用、程序化工具调用和多Agent能力。(openai.com)

因此,需要以下能力的应用不能只比较Token价格:

  • 图片分析
  • UI截图理解
  • 图表识别
  • 计算机操作
  • 完整文件工具
  • 多模态Agent
  • OpenAI内置Code Interpreter
  • 服务端长任务状态管理

正式版Agent成绩

DeepSeek公布的V4-Flash-0731主要Agent测试成绩包括:

测试项目成绩
Terminal Bench 2.182.7
NL2Repo54.2
CyberGym76.7
DeepSWE54.4
Toolathlon Verified70.3
Agent Last Exam25.2
Automation Bench Public25.1
DSBench-FullStack68.7
DSBench-Hard59.6

DeepSeek称,这些结果远超V4-Pro预览版。(api-docs.deepseek.com)

需要注意:

  • 测试使用了DeepSeek Harness极简模式
  • 推理强度设置为max
  • top_p=0.95
  • temperature=1.0
  • DSBench属于DeepSeek内部测试集

不同Agent框架和参数会明显影响最终成绩,因此不能只比较裸模型名称。

DeepSeek是否在综合性能上超过GPT-5.6?

不能根据当前资料得出这一结论。

GPT-5.6 Sol仍然是面向高难度代码、知识工作、科学、网络安全和复杂Agent任务的旗舰模型。OpenAI公布的Artificial Analysis Intelligence Index成绩显示,GPT-5.6 Sol明显高于DeepSeek V4-Flash。(openai.com) (artificialanalysis.ai)

DeepSeek的主要优势是:

  • 价格极低
  • 首Token速度较快
  • 100万Token上下文
  • Agent专项能力较强
  • 适配Codex
  • 并发上限高
  • API迁移成本低

GPT-5.6系列的主要优势是:

  • 更强的综合能力上限
  • 原生视觉输入
  • 更完整的工具生态
  • 计算机使用
  • 多Agent协同
  • 服务端对话状态
  • 更成熟的Responses API
  • Sol高速推理服务
  • Luna更高持续输出速度

所以,DeepSeek并不是在所有能力上替代GPT,而是在价格与部分Agent场景中提供了非常有竞争力的选择。

对AI商业化意味着什么?

V4-Flash把百万Token输出价格压到2元人民币后,很多过去成本较高的产品开始具备更现实的商业模型。

低价AI客服

企业可以允许Agent读取更长的历史记录、调用更多工具,而不必过度限制每轮输出。

AI编程工具

代码Agent可以进行更多次测试、修复和重试,减少因Token预算过低而提前停止任务。

自动研究与内容生成

搜索Agent可以读取更多资料并输出更完整的研究报告。

企业流程自动化

模型可以持续调用CRM、ERP、数据库和内部接口,完成多步骤业务流程。

个人AI产品

个人开发者不需要预先投入较高模型费用,也能测试具备长上下文和Agent能力的产品。

批量内容处理

适合文档分类、数据提取、信息整理、翻译和批量改写。

低价不等于总成本一定最低

模型调用费用只是AI产品成本的一部分。

一个正式Agent系统还需要支付:

  • 搜索API
  • 浏览器环境
  • 沙箱服务器
  • 数据库存储
  • 向量检索
  • 文件解析
  • 工具调用
  • 任务队列
  • 日志与监控
  • 人工审核
  • 失败重试

如果模型更容易出现:

  • 工具调用失败
  • 长任务绕路
  • 代码无法运行
  • 搜索结果误判
  • 需要多轮重试

那么节省的Token费用可能被额外执行成本抵消。

企业应重点计算:

单次成功任务总成本
=
模型费用
+
工具费用
+
计算资源
+
失败重试
+
人工审核

而不是只看每百万Token单价。

如何选择DeepSeek或GPT-5.6?

适合优先选择DeepSeek V4-Flash

  • 成本敏感
  • 主要处理中文和文本
  • 需要100万Token上下文
  • 高并发请求
  • 代码和终端Agent
  • 批量自动化
  • 已有OpenAI兼容客户端
  • 愿意自己管理会话状态
  • 不依赖图片和计算机操作

适合选择GPT-5.6 Luna

  • 需要较高持续输出速度
  • 需要图片输入
  • 希望使用OpenAI完整生态
  • 任务复杂度中等
  • 需要更成熟的Responses API

适合选择GPT-5.6 Terra

  • 希望在能力、价格和速度之间平衡
  • 需要多模态与完整工具能力
  • 已经深度接入OpenAI平台

适合选择GPT-5.6 Sol

  • 高难度专业任务
  • 复杂软件工程
  • 科学研究
  • 网络安全
  • 高价值企业决策
  • 需要计算机使用和多Agent
  • 任务成功率比模型单价更重要

推荐采用模型路由

实际产品不必只选择一个模型。

可以根据任务难度建立分层策略:

DeepSeek V4-Flash处理

  • 普通问答
  • 文档提取
  • 批量分类
  • 基础代码任务
  • 搜索整理
  • 常规Agent执行

GPT-5.6 Luna或Terra处理

  • 图片理解
  • 多模态办公
  • 更高输出速度
  • 需要OpenAI内置工具的任务

GPT-5.6 Sol处理

  • Flash连续失败的任务
  • 复杂工程问题
  • 高风险专业分析
  • 多Agent长程任务
  • 高价值最终审核

这种路由可以减少模型费用,同时保留高难度任务的能力上限。

DeepSeek即将采用峰谷定价

DeepSeek官方价格页面显示,未来API将引入峰谷定价。

高峰时段价格将调整为普通价格的2倍,时间为北京时间:

  • 每日9:00—12:00
  • 每日14:00—18:00

具体生效时间尚未正式公布。(api-docs.deepseek.com)

价格生效后,V4-Flash高峰期可能变为:

  • 缓存命中输入:0.04元/百万Token
  • 缓存未命中输入:2元/百万Token
  • 输出:4元/百万Token

即使按高峰价计算,其价格仍然明显低于GPT-5.6 Terra和Sol。

企业可以将不需要实时完成的任务安排到非高峰时段,例如:

  • 批量报告
  • 数据清洗
  • 夜间代码检查
  • 每日资讯整理
  • 知识库更新
  • 离线内容生成

接入前需要注意什么?

不要继续使用旧模型名

deepseek-chatdeepseek-reasoner已经停止推荐使用,新项目应直接使用:

deepseek-v4-flash

(api-docs.deepseek.com)

自行保存Responses API状态

DeepSeek不支持previous_response_id,需要应用自行管理历史记录。

不要提交图片和文件

V4-Flash当前只能处理文本。

检查静默忽略的参数

部分OpenAI Responses API参数即使不支持,也不会报错。

限制Agent权限

文件删除、代码部署、付款和外部消息发送应保留人工确认。

测试实际业务成功率

不要只使用公开Benchmark,应使用自己的代码库、文档和工作流测试。

计算完整任务成本

同时记录模型Token、工具调用、重试和人工审核费用。

总结

DeepSeek-V4-Flash-0731已经正式上线API并开启公测。

模型保持2840亿总参数、130亿激活参数的MoE架构,支持100万Token上下文和最长38.4万Token输出。本次更新没有增加参数,而是通过重新后训练明显强化Agent、终端、代码仓库和工具调用能力。(api-docs.deepseek.com)

价格方面,DeepSeek V4-Flash官方定价为:

  • 输入缓存命中:0.02元/百万Token
  • 输入缓存未命中:1元/百万Token
  • 输出:2元/百万Token

这一价格明显低于GPT-5.6 Luna、Terra和Sol,尤其是输出价格相比GPT-5.6 Sol低约99%。(api-docs.deepseek.com) (openai.com)

速度方面,DeepSeek V4-Flash在第三方测试中:

  • 比GPT-5.6 Sol High输出更快
  • 与GPT-5.6 Terra High基本接近
  • 首Token时间通常较短
  • 持续输出速度低于GPT-5.6 Luna
  • 也低于GPT-5.6 Sol的特定高速服务

(artificialanalysis.ai) (artificialanalysis.ai)

因此,“价格全面低于GPT-5.6”有数据支持,但“速度全面碾压GPT”并不成立。

V4-Flash真正带来的变化,是让100万Token上下文、长程Agent和高频工具调用进入一个更低的价格区间。

对于主要处理文本、代码、搜索和企业自动化的开发者而言,它可能成为成本非常有竞争力的基础模型;对于图片理解、计算机操作、多Agent和高难度专业任务,GPT-5.6系列仍然拥有更完整的能力与生态。

AI商业化的门槛确实在下降,但未来真正决定产品竞争力的,不只是每百万Token多少钱,而是:

用多少成本,能够稳定完成多少真实任务。

相关链接