千问AI平台又扩容:DeepSeek V4.1 Flash 来了,API 和 Token Plan 同步开放

千问 AI 平台又接了一款新旗舰。
DeepSeek V4.1 Flash 正式上线。
而且这次不是只把模型挂进模型广场。
同步开放的还有:
API 按量调用
以及:
Token Plan。
模型 ID 直接使用:
deepseek-v4.1-flash
就可以调用。
也就是说,原本已经通过千问 AI 平台调用:
Qwen;
DeepSeek;
GLM;
Kimi;
MiniMax;
MiMo
等模型的开发者,现在又可以把 DeepSeek 最新的 V4.1 Flash 直接放进同一套开发环境里。
一、名字叫 Flash,参数其实有 552B
DeepSeek V4.1 Flash 是 DeepSeek 新一代模型架构中的:
轻量旗舰模型。
模型总参数达到:
552B。
但它采用了新的:
Causal Encoder-Decoder 非对称架构。
输入阶段只激活:
约 8B 参数。
输出阶段激活:
约 16B 参数。
也就是说,它不是简单靠缩小整个模型换速度。
而是在保持大模型容量的同时:
大幅降低每次真正参与计算的参数量。
这也是 V4.1 Flash 最核心的一条路线:
大模型容量 + 小激活量。
二、Flash 已经开始干掉上一代 Pro
更有意思的是:
DeepSeek 官方已经表示,V4.1 Flash 在多项测试中超过了:
DeepSeek V4 Pro。
包括:
性能;
速度;
费用;
任务总耗时。
上一代 V4 Pro 甚至已经进入退役流程。
从 9 月 14 日 12:00 起,DeepSeek 官方 API 中:
deepseek-v4-pro
已经开始路由至:
V4.1 Flash。
直到未来:
V4.1 Pro
正式上线。
所以这一代“Flash”的定位已经很明显了。
不再是:
便宜一点,所以能力弱一点。
而是:
先用 Flash 吃掉上一代 Pro 的能力区间。
三、原生多模态也一起接进千问AI平台了
V4.1 Flash 原生支持:
视觉理解。
千问 AI 平台当前模型页已经明确支持:
文本输入
以及:
图像输入。
输出为文本。
所以开发者现在可以直接拿它处理:
截图;
图表;
扫描件;
网页界面;
产品图片;
文档图片。
例如:
看一下这张后台截图,分析里面的数据异常。
或者:
读取这张表格截图,把所有字段提取成 JSON。
对于 Agent 来说,这一点非常重要。
因为真正的电脑工作环境从来都不只有:
纯文本。
四、上下文直接给到1M
千问 AI 平台上的 DeepSeek V4.1 Flash 支持:
1M Token 上下文。
最大输出约:
384K Token。
这意味着它比较适合直接处理:
大型代码仓库;
超长 PDF;
企业知识库;
会议记录;
合同集合;
研究资料;
长期 Agent Session。
以前几十份资料可能还需要:
切片;
摘要;
多轮整理。
现在很多任务已经可以直接放进:
百万 Token 上下文。
尤其适合企业 RAG 和知识库场景。
五、真正适合企业的,反而是KV Cache降下来了
Agent 时代有一个越来越明显的问题:
上下文越长,缓存越贵。
一次复杂 Agent 任务可能需要不断重复读取:
System Prompt;
工具定义;
代码;
企业文档;
历史对话。
V4.1 Flash 这次针对 KV Cache 做了大幅压缩。
相比上一代:
HBM需求降低到:
1/4。
SSD缓存需求降低到:
1/8。
相比 DeepSeek 初代架构:
KV Cache 已经累计缩小约:
437倍。
这个优化可能没有 Benchmark 那么吸睛。
但对于企业真正长期跑:
客服 Agent;
Coding Agent;
知识库;
研究 Agent
来说,
它直接关系到:
每个任务到底要花多少钱。
六、千问AI平台这边也给了Context Cache
除了模型自身架构优化,
千问 AI 平台还提供:
Context Cache。
对于多个请求拥有相同前缀的任务:
可以缓存公共上下文。
比如企业客服:
系统规则
+
企业产品知识
+
客服规范
+
用户当前问题前面大段内容可能每次都完全一样。
真正变化的:
只有最后一个用户问题。
通过缓存:
可以减少重复计算;
降低延迟;
控制 Token 成本。
这类能力对:
客服知识库;
企业助手;
长文档 Agent
尤其有用。
七、API不是只能“聊天”,内置工具也接进来了
千问 AI 平台上的 V4.1 Flash 目前不仅支持普通:
Chat Completions。
还支持:
Responses API。
并可以结合平台内置工具。
目前包括:
联网搜索
网页抓取
代码解释器
等。
例如你可以直接让 Agent:
搜索最新资料
↓
抓取网页
↓
读取内容
↓
运行代码分析
↓
让V4.1 Flash推理
↓
输出最终结果不需要每个能力都自己从头搭一套 Tool。
这对做:
Deep Research;
数据分析;
行业研究;
Coding Agent
会方便很多。
八、函数调用、JSON输出这些企业功能也都支持
目前 V4.1 Flash 在千问 AI 平台还支持:
Function Calling
结构化输出
前缀补全
Context Cache
联网搜索
等能力。
比如企业要做一个:
订单查询 Agent。
模型并不是自己编一个答案。
而是通过 Function Calling:
用户询问订单
↓
模型识别意图
↓
调用订单API
↓
获取真实数据
↓
模型整理结果这才是真正能接入业务系统的:
企业 Agent。
九、API按量计费,也可以直接走Token Plan
这次比较方便的是:
两种使用方式同步开放。
API按量计费
适合:
自己的 App;
SaaS;
企业后台;
自动化系统;
生产环境服务。
根据实际 Token 消耗付费。
千问 AI 平台当前模型页显示,错峰时段为:
22:00—次日08:00。
当前页面展示的错峰价格为:
输入:
1 元 / 百万 Token
输出:
4 元 / 百万 Token
缓存命中输入:
0.1 元 / 百万 Token。
实际价格还是建议以模型页面实时显示为准。
十、开发者自己用,则可以直接走Token Plan
如果主要是在:
Codex;
Claude Code;
Cursor;
Qwen Code;
Qoder;
OpenClaw
这些 Agent 工具里使用,
则可以直接选择:
Token Plan。
目前:
个人版;
团队版
都已经可以配置:
deepseek-v4.1-flash
个人版当前还有一个挺适合夜猫子的权益:
每天:
22:00—次日08:00
调用 DeepSeek V4.1 Flash:
Credits 消耗限时5折。
又是一个:
晚上别睡,起来蹬 Agent
的活动。
十一、但Token Plan不能拿来当便宜API服务器
这里需要特别注意。
Token Plan 个人版本质上是:
面向个人开发者的交互式订阅。
适合放在:
Coding Agent;
智能体工具
里面自己使用。
不能直接把 Token Plan API Key 塞进:
网站后端;
自动化脚本;
商业 SaaS;
批量 API 服务
当成廉价 API。
如果是:
真正线上业务;
批量任务;
产品后端,
还是应该使用:
正常按量计费 API。
这个区别最好提前搞清楚。
十二、千问AI平台越来越像“大模型统一入口”
我觉得这次真正值得关注的不只是:
又增加了一个 DeepSeek。
千问 AI 平台现在正在把不同厂商旗舰模型逐渐放进:
同一个 API 体系。
目前已经可以看到:
千问自己的 Qwen3.8;
DeepSeek V4.1 Flash;
DeepSeek V4 Pro;
GLM;
Kimi;
MiniMax;
MiMo
等模型。
开发者不需要每接一个模型:
重新注册平台;
重新充钱;
重新写 SDK;
重新维护不同接口。
很多模型直接通过:
OpenAI兼容协议
或者:
Anthropic兼容协议
进行调用。
这样以后做 Agent,真正有意思的玩法就来了:
简单任务
→ Flash模型
复杂推理
→ 旗舰模型
视觉任务
→ 多模态模型
Coding
→ Coding模型模型本身开始变成:
可以按任务动态调度的算力资源。
结语
DeepSeek V4.1 Flash 上线千问 AI 平台以后,可以记住几个核心参数:
552B 总参数。
输入激活约8B。
输出激活约16B。
原生支持:
文本 + 图像理解。
上下文:
1M Token。
最大输出:
约384K Token。
同时支持:
Function Calling;
结构化输出;
Context Cache;
联网搜索;
网页抓取;
代码解释器。
使用方式也同时覆盖:
API 按量计费
以及:
Token Plan。
这也是千问 AI 平台最近越来越明显的一条路线:
它不再只卖:
“千问模型”。
而是开始变成:
一个平台调用多家旗舰模型。
对于普通开发者来说,真正爽的其实不是:
模型列表越来越长。
而是以后做 Agent 时,
可以根据:
性能;
成本;
视觉能力;
推理能力;
任务类型
随时换模型。
模型可以变,接口不用跟着重写。
这可能才是多模型平台真正有价值的地方。
相关链接
DeepSeek V4.1 Flash 千问AI平台模型页
https://www.qianwenai.com/models/deepseek-v4.1-flash
千问AI平台
千问AI平台模型发布记录
https://platform.qianwenai.com/docs/changelog/models
千问AI平台 Token Plan
https://platform.qianwenai.com/docs/token-plan/personal/token-plan-personal-overview
千问AI平台 API 文档
https://platform.qianwenai.com/docs/
DeepSeek V4.1 Flash 官方发布
https://deepseek.com/news/deepseek-v4-1-flash/
DeepSeek V4.1 Flash 开源模型
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
标签






评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。