推荐Lovart 中文版 - 一站式 AI 设计平台推荐一人企业Vibe Coding社区!热门AI设计工具新品免费AI编程工具 Trae - 智能编码助手Seedance2.5已上线新用户注册即领免费算力
UIED.CN今天偷学哪一招,朋友

千问AI平台又扩容:DeepSeek V4.1 Flash 来了,API 和 Token Plan 同步开放

image.png

千问 AI 平台又接了一款新旗舰。

DeepSeek V4.1 Flash 正式上线。

而且这次不是只把模型挂进模型广场。

同步开放的还有:

API 按量调用

以及:

Token Plan。

模型 ID 直接使用:

deepseek-v4.1-flash

就可以调用。

也就是说,原本已经通过千问 AI 平台调用:

Qwen;

DeepSeek;

GLM;

Kimi;

MiniMax;

MiMo

等模型的开发者,现在又可以把 DeepSeek 最新的 V4.1 Flash 直接放进同一套开发环境里。




一、名字叫 Flash,参数其实有 552B

DeepSeek V4.1 Flash 是 DeepSeek 新一代模型架构中的:

轻量旗舰模型。

模型总参数达到:

552B。

但它采用了新的:

Causal Encoder-Decoder 非对称架构。

输入阶段只激活:

约 8B 参数。

输出阶段激活:

约 16B 参数。

也就是说,它不是简单靠缩小整个模型换速度。

而是在保持大模型容量的同时:

大幅降低每次真正参与计算的参数量。

这也是 V4.1 Flash 最核心的一条路线:

大模型容量 + 小激活量。




二、Flash 已经开始干掉上一代 Pro

更有意思的是:

DeepSeek 官方已经表示,V4.1 Flash 在多项测试中超过了:

DeepSeek V4 Pro。

包括:

性能;

速度;

费用;

任务总耗时。

上一代 V4 Pro 甚至已经进入退役流程。

从 9 月 14 日 12:00 起,DeepSeek 官方 API 中:

deepseek-v4-pro

已经开始路由至:

V4.1 Flash。

直到未来:

V4.1 Pro

正式上线。

所以这一代“Flash”的定位已经很明显了。

不再是:

便宜一点,所以能力弱一点。

而是:

先用 Flash 吃掉上一代 Pro 的能力区间。




三、原生多模态也一起接进千问AI平台了

V4.1 Flash 原生支持:

视觉理解。

千问 AI 平台当前模型页已经明确支持:

文本输入

以及:

图像输入。

输出为文本。

所以开发者现在可以直接拿它处理:

截图;

图表;

扫描件;

网页界面;

产品图片;

文档图片。

例如:

看一下这张后台截图,分析里面的数据异常。

或者:

读取这张表格截图,把所有字段提取成 JSON。

对于 Agent 来说,这一点非常重要。

因为真正的电脑工作环境从来都不只有:

纯文本。




四、上下文直接给到1M

千问 AI 平台上的 DeepSeek V4.1 Flash 支持:

1M Token 上下文。

最大输出约:

384K Token。

这意味着它比较适合直接处理:

大型代码仓库;

超长 PDF;

企业知识库;

会议记录;

合同集合;

研究资料;

长期 Agent Session。

以前几十份资料可能还需要:

切片;

摘要;

多轮整理。

现在很多任务已经可以直接放进:

百万 Token 上下文。

尤其适合企业 RAG 和知识库场景。




五、真正适合企业的,反而是KV Cache降下来了

Agent 时代有一个越来越明显的问题:

上下文越长,缓存越贵。

一次复杂 Agent 任务可能需要不断重复读取:

System Prompt;

工具定义;

代码;

企业文档;

历史对话。

V4.1 Flash 这次针对 KV Cache 做了大幅压缩。

相比上一代:

HBM需求降低到:

1/4。

SSD缓存需求降低到:

1/8。

相比 DeepSeek 初代架构:

KV Cache 已经累计缩小约:

437倍。

这个优化可能没有 Benchmark 那么吸睛。

但对于企业真正长期跑:

客服 Agent;

Coding Agent;

知识库;

研究 Agent

来说,

它直接关系到:

每个任务到底要花多少钱。




六、千问AI平台这边也给了Context Cache

除了模型自身架构优化,

千问 AI 平台还提供:

Context Cache。

对于多个请求拥有相同前缀的任务:

可以缓存公共上下文。

比如企业客服:

系统规则
+
企业产品知识
+
客服规范
+
用户当前问题

前面大段内容可能每次都完全一样。

真正变化的:

只有最后一个用户问题。

通过缓存:

可以减少重复计算;

降低延迟;

控制 Token 成本。

这类能力对:

客服知识库;

企业助手;

长文档 Agent

尤其有用。




七、API不是只能“聊天”,内置工具也接进来了

千问 AI 平台上的 V4.1 Flash 目前不仅支持普通:

Chat Completions。

还支持:

Responses API。

并可以结合平台内置工具。

目前包括:

联网搜索

网页抓取

代码解释器

等。

例如你可以直接让 Agent:

搜索最新资料
↓
抓取网页
↓
读取内容
↓
运行代码分析
↓
让V4.1 Flash推理
↓
输出最终结果

不需要每个能力都自己从头搭一套 Tool。

这对做:

Deep Research;

数据分析;

行业研究;

Coding Agent

会方便很多。




八、函数调用、JSON输出这些企业功能也都支持

目前 V4.1 Flash 在千问 AI 平台还支持:

Function Calling

结构化输出

前缀补全

Context Cache

联网搜索

等能力。

比如企业要做一个:

订单查询 Agent。

模型并不是自己编一个答案。

而是通过 Function Calling:

用户询问订单
↓
模型识别意图
↓
调用订单API
↓
获取真实数据
↓
模型整理结果

这才是真正能接入业务系统的:

企业 Agent。




九、API按量计费,也可以直接走Token Plan

这次比较方便的是:

两种使用方式同步开放。

API按量计费

适合:

自己的 App;

SaaS;

企业后台;

自动化系统;

生产环境服务。

根据实际 Token 消耗付费。

千问 AI 平台当前模型页显示,错峰时段为:

22:00—次日08:00。

当前页面展示的错峰价格为:

输入:

1 元 / 百万 Token

输出:

4 元 / 百万 Token

缓存命中输入:

0.1 元 / 百万 Token。

实际价格还是建议以模型页面实时显示为准。




十、开发者自己用,则可以直接走Token Plan

如果主要是在:

Codex;

Claude Code;

Cursor;

Qwen Code;

Qoder;

OpenClaw

这些 Agent 工具里使用,

则可以直接选择:

Token Plan。

目前:

个人版;

团队版

都已经可以配置:

deepseek-v4.1-flash

个人版当前还有一个挺适合夜猫子的权益:

每天:

22:00—次日08:00

调用 DeepSeek V4.1 Flash:

Credits 消耗限时5折。

又是一个:

晚上别睡,起来蹬 Agent

的活动。




十一、但Token Plan不能拿来当便宜API服务器

这里需要特别注意。

Token Plan 个人版本质上是:

面向个人开发者的交互式订阅。

适合放在:

Coding Agent;

智能体工具

里面自己使用。

不能直接把 Token Plan API Key 塞进:

网站后端;

自动化脚本;

商业 SaaS;

批量 API 服务

当成廉价 API。

如果是:

真正线上业务;

批量任务;

产品后端,

还是应该使用:

正常按量计费 API。

这个区别最好提前搞清楚。




十二、千问AI平台越来越像“大模型统一入口”

我觉得这次真正值得关注的不只是:

又增加了一个 DeepSeek。

千问 AI 平台现在正在把不同厂商旗舰模型逐渐放进:

同一个 API 体系。

目前已经可以看到:

千问自己的 Qwen3.8;

DeepSeek V4.1 Flash;

DeepSeek V4 Pro;

GLM;

Kimi;

MiniMax;

MiMo

等模型。

开发者不需要每接一个模型:

重新注册平台;

重新充钱;

重新写 SDK;

重新维护不同接口。

很多模型直接通过:

OpenAI兼容协议

或者:

Anthropic兼容协议

进行调用。

这样以后做 Agent,真正有意思的玩法就来了:

简单任务
→ Flash模型

复杂推理
→ 旗舰模型

视觉任务
→ 多模态模型

Coding
→ Coding模型

模型本身开始变成:

可以按任务动态调度的算力资源。




结语

DeepSeek V4.1 Flash 上线千问 AI 平台以后,可以记住几个核心参数:

552B 总参数。

输入激活约8B。

输出激活约16B。

原生支持:

文本 + 图像理解。

上下文:

1M Token。

最大输出:

约384K Token。

同时支持:

Function Calling;

结构化输出;

Context Cache;

联网搜索;

网页抓取;

代码解释器。

使用方式也同时覆盖:

API 按量计费

以及:

Token Plan。

这也是千问 AI 平台最近越来越明显的一条路线:

它不再只卖:

“千问模型”。

而是开始变成:

一个平台调用多家旗舰模型。

对于普通开发者来说,真正爽的其实不是:

模型列表越来越长。

而是以后做 Agent 时,

可以根据:

性能;

成本;

视觉能力;

推理能力;

任务类型

随时换模型。

模型可以变,接口不用跟着重写。

这可能才是多模型平台真正有价值的地方。




相关链接

DeepSeek V4.1 Flash 千问AI平台模型页

https://www.qianwenai.com/models/deepseek-v4.1-flash

千问AI平台

https://www.qianwenai.com/

千问AI平台模型发布记录

https://platform.qianwenai.com/docs/changelog/models

千问AI平台 Token Plan

https://platform.qianwenai.com/docs/token-plan/personal/token-plan-personal-overview

千问AI平台 API 文档

https://platform.qianwenai.com/docs/

DeepSeek V4.1 Flash 官方发布

https://deepseek.com/news/deepseek-v4-1-flash/

DeepSeek V4.1 Flash 开源模型

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash







标签

评论 0

最新评论

登录后发布评论并参与互动。

暂无评论,欢迎抢沙发。

推荐阅读

查看更多