推荐Lovart 中文版 - 一站式 AI 设计平台推荐一人企业Vibe Coding社区!热门AI设计工具新品免费AI编程工具 Trae - 智能编码助手Seedance2.5已上线新用户注册即领免费算力
UIED.CN今天偷学哪一招,朋友

DeepSeek Harness v0.1.5 发布:V4.1 Flash 专项训练,模型开始和 Harness 一起进化

DeepSeek Harness 又更新了。

image.png

这次升级到:

v0.1.5。

但相比普通的 UI 优化、Bug 修复,这一版真正值得关注的是:

DeepSeek V4.1 Flash 开始针对 Harness 本身进行专项训练。

不是先把模型训练完,再丢进 Agent 框架里看看能不能用。

而是:

Model
+
Harness
+
真实Agent任务
↓
一起训练和优化

这其实和 DeepSeek 此前一直强调的:

Agent = Model + Harness

越来越对上了。

模型不再单独卷能力。

Harness 也不只是外面套的一层工具框架。

两边开始真正:

共同进化。




一、V4.1 Flash 针对三种 Harness 模式专项优化

DeepSeek V4.1 Flash 这次并不是只针对一种 Agent 配置训练。

目前覆盖:

标准模式 Standard

PTC 模式

以及:

极简模式 Minimal。

三种模式代表的 Harness 强度完全不同。

标准模式

提供完整:

工具;

Skills;

文件;

Shell;

任务规划;

上下文管理

等能力。

更接近日常使用的完整 Coding Agent。

PTC 模式

PTC 可以理解成:

Programmatic Tool Calling,程序化工具调用。

模型不是每一步:

调用一个 Tool → 等结果 → 再回来思考。

而是可以生成一段代码,将多轮工具调用组织起来。

比如一次批量完成:

搜索文件;

读取代码;

分析结果;

修改内容。

复杂 Agent 任务的工具调度效率会更高。

极简模式

则故意把 Harness 压到非常轻。

只给模型最基础的:

Terminal;

文件编辑。

更适合观察:

模型自己到底能干多少。

V4.1 Flash 同时针对三种环境训练,说明 DeepSeek 已经开始研究:

同一个模型面对不同 Harness 时,应该怎么工作。




二、连系统提示词更新都开始考虑 KV Cache

这一版还有一个很“工程”的升级:

在使用 DeepSeek V4.1 Flash 时,Harness 可以在:

尽量保留已有 KV Cache

的情况下更新系统提示词。

这个能力对普通聊天没那么明显。

但长程 Agent 特别重要。

因为一个任务跑几十轮以后:

前面的系统提示词;

Tool Schema;

对话历史;

任务上下文

可能已经占掉大量 Token。

如果系统提示词稍微发生变化,导致整个 Prefix Cache 失效:

前面大量内容都要重新计算。

成本和延迟都会上升。

v0.1.5 开始让新的系统提示信息追加到已有历史后方,在满足条件时尽量保持前面已经缓存的内容。

说白了:

Agent 一边工作,规则还能继续更新,但别把前面算过的 Token 全浪费掉。




三、现在可以直接上传 PDF 和图片了

新版 Web UI 对文件任务也补得比较完整。

现在可以直接上传:

图片;

PDF;

以及更多类型文件。

文件进入 Workspace 后,模型并不是一次性把所有内容全部塞进 Context。

而是通过文件工具:

按需读取。

这点很重要。

比如上传一本:

300 页 PDF。

Agent 不一定第一轮就需要读完整本。

它可以先判断任务,再按需读取对应内容。

相比把所有文件全部暴力塞进上下文:

会更加适合长任务。




四、右侧 Sidebar 终于真的像工作台了

以前使用 Harness 做文件任务,一个很明显的问题是:

Agent 在改文件,但用户不方便看。

现在右侧 Sidebar 已经可以直接浏览:

Workspace 文件树。

并支持预览:

Markdown

HTML

PDF

常见代码

图片

等内容。

Agent 刚刚生成:

README;

网页;

报告;

代码文件;

PDF。

不需要离开 Harness。

直接右边点开就能看。

如果需要使用系统应用,还可以:

打开默认程序;

或者直接定位到文件管理器。

整个体验开始从:

聊天框 + Agent

继续往:

真正的工作空间

靠。




五、插件现在终于有了标准 UI 位置

这个我觉得是 v0.1.5 非常关键的一块。

DeepSeek Harness 从第一天就喊:

Everything is a Plugin。

但插件想真正做成完整产品,仅仅能增加一个 Tool 还不够。

它还需要:

自己的入口;

页面;

设置;

可视化界面。

v0.1.5 开始在 Web UI 左右两侧建立标准扩展位。

左侧 Sidebar

插件可以在:

“新会话”

和:

“工作区”

之间注册全局入口。

点击以后,可以和中央内容区域联动。

右侧 Sidebar

插件可以注册新的:

Tab;

预览页面;

工具面板。

并支持:

多标签;

分栏;

全屏。

这意味着以后一个插件完全可以拥有自己的:

数据面板;

浏览器;

文件查看器;

任务管理;

设计预览;

监控工具。

Harness 的 UI 本身开始变成:

一个可以被插件扩展的壳。

这才真正符合:

“一切皆插件”。




六、父 Agent 和子 Agent 终于可以边干边聊

多 Agent 还有一个很现实的问题:

以前主 Agent 把任务派出去以后,

子 Agent 就埋头做。

突然发现:

方向错了。

怎么办?

新版进一步加强:

Continuable Subagent。

父 Agent 和仍在执行的子 Agent 可以继续:

双向发送消息;

补充信息;

修改任务方向;

打断当前任务。

用户也可以:

排队发送消息;

编辑等待中的指令;

删除消息;

插话;

停止任务。

甚至主 Agent 还可以为子 Agent 分别选择:

模型

和:

推理强度。

以后一个团队里完全可以:

简单任务 → Flash;

复杂验证 → 强模型;

关键 Reviewer → 高推理。

多 Agent 不再等于:

一堆一样的模型同时跑。




七、Agent Teams:这次真的开始“组队干活”了

v0.1.5 里最有意思的实验功能之一:

Agent Teams。

它允许主 Agent 创建多个长期存在的:

Team Member。

然后通过共享任务列表:

拆分任务;

分配任务;

追踪状态。

比如做一个完整网站,可以组:

Frontend Agent
→ 写前端

Backend Agent
→ 做接口

Design Review Agent
→ 检查UI

Test Agent
→ 负责测试

不同成员之间甚至可以:

互相发消息。

主 Agent 则负责:

查看进度;

等待成员完成;

重新分配;

中断任务;

最后统一汇总。

Web UI 还可以直接查看:

团队成员;

共享任务;

每个成员自己的子会话。

这已经很接近:

一个 AI 项目团队。




八、但 Agent Teams 现在还是实验功能

这里需要注意。

Agent Teams 当前并不是:

默认开启的稳定功能。

而是放在:

Experimental Plugin

中。

默认关闭。

需要开发者自己通过命令行,将对应实验插件加入 Profile。

而且多 Agent 最大的副作用也非常直接:

烧 Token。

一个任务原本只有一个 Agent。

现在同时开:

4 个 Agent。

每个都有:

System Prompt;

Context;

Tools;

推理;

任务历史。

消耗自然会明显增加。

所以 Agent Teams 更适合真正需要:

并行研究;

复杂软件项目;

多视角 Review

的场景。

不是每个任务都需要拉一个 AI 公司出来开会。




九、长会话终于开始重点优化性能

Harness 真正跑起来后,很多人的第一个感受就是:

越聊越重。

Session 越长:

历史越多;

Tool Result 越多;

文件越多。

内存、Token、加载时间都会继续上涨。

v0.1.5 继续优化:

长会话加载;

Session 恢复;

持续对话;

内存占用;

存储格式。

同时新增或完善:

历史轮次导航;

消息折叠;

正文宽度;

字号;

运行统计。

这些东西看起来不像:

“模型能力提升30%”

那么炸。

但对每天真正使用 Agent 几小时的人来说:

反而特别影响体验。




十、真正值得看的,是 Model × Harness 开始一起训练

我觉得这一版最重要的其实还是第一条:

V4.1 Flash 针对 DeepSeek Harness 专项训练。

以前做 Agent 的典型方式是:

模型公司
↓
发布模型

Agent公司
↓
拿模型接工具
↓
自己写Prompt
↓
调Harness

现在 DeepSeek 开始把两件事直接放在一起:

Harness设计
↓
构造真实Agent任务
↓
训练模型
↓
模型在Harness里运行
↓
暴露失败
↓
继续修改模型和Harness

这意味着未来模型 Benchmark 可能都不能完全说明问题。

同一款模型:

放进不同 Harness。

表现可能完全不一样。

反过来:

同一套 Harness,如果模型从训练阶段就已经学会如何使用它:

Agent 能力也可能进一步提升。

这就是:

Model-Harness Co-Training。




十一、如何安装体验?

如果已经安装 Node.js,可以直接运行:

npx @deepseek-ai/dsh web

启动 DeepSeek Harness Web UI。

如果想从源码运行:

git clone https://github.com/deepseek-ai/deepseek-harness
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web

目前 DeepSeek Harness 仍然属于:

Developer Preview。

更新速度非常快,也明确可能存在兼容性变化。

所以如果用于正式生产项目:

版本最好锁定。

不要每天无脑跟最新 Alpha。




结语

DeepSeek Harness v0.1.5 这次表面上新增了很多东西:

文件上传。

Sidebar文件预览。

插件UI扩展。

子Agent双向通信。

Agent Teams。

长会话优化。

但真正值得关注的主线其实只有一句:

DeepSeek 开始让模型和 Harness 一起训练了。

V4.1 Flash 针对:

Standard;

PTC;

Minimal

三种 Harness 配置进行专项优化。

Harness 又反过来根据模型能力继续调整:

系统提示词;

KV Cache;

工具调用;

子 Agent;

多 Agent 协作。

以前大家卷的是:

模型有多强。

后来开始卷:

Harness 有多强。

现在下一步已经越来越明显:

模型 × Harness 到底能不能一起变强。

这可能才是 Agent 时代真正决定体验上限的一块。

毕竟一个再聪明的模型,

如果不知道:

怎么用工具;

怎么管理文件;

怎么和其他 Agent 协作;

怎么在长任务里保持目标,

也很难真正完成复杂工作。

所以 DeepSeek 那句:

Agent = Model + Harness

现在看,越来越不像一句宣传语了。




相关链接

DeepSeek Harness GitHub

https://github.com/deepseek-ai/deepseek-harness

DeepSeek Harness 官网

https://deepseek.com/harness/

DeepSeek Harness 官方文档

https://deepseek-harness.github.io/deepseek-harness/

Agent Teams 官方文档

https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/subsystems/agent-team.md

DeepSeek API 官方文档

https://api-docs.deepseek.com/

DeepSeek 官网

https://www.deepseek.com/








标签

评论 0

最新评论

登录后发布评论并参与互动。

暂无评论,欢迎抢沙发。

推荐阅读

查看更多