DeepSeek Harness 深度体验:把万物皆插件做到极致的 AI 编程 Agent
DeepSeek Harness 深度体验:把万物皆插件做到极致的 AI 编程 Agent
上周给 computeforge.cn 做流量预估,我在浏览器里开了十几个标签页,边翻数据边截图,翻到半夜一点才攒了两页笔记,烦得不行,才想起来试几天前刚冒出来的 DeepSeek Harness。当时我就一个念头:让它自己去查,自己算,给我一份报告就收工。
结果这一试,它还真把这活接住了。
凌晨两分钟装完,第一眼没什么可吹的
安装没什么可讲的:一条 npx 命令拉起来,大概三分钟,版本号 0.1.0-rc.6,典型还没打磨完的样子。装完我好奇扫了眼 node_modules,里面躺着两百多个 @deepseek-ai/dsh-* 开头的包,光名字就铺了一屏。
浏览器打开 localhost:3080,界面说不上好看,就是个开源工程后台的脸:左边一列面板菜单,中间聊天区,右边留白。我当时心里想,又一个套壳聊天框。然后我瞥见右下角有个入口标着 Trajectory,当时没当回事。

凌晨 5 点 33,我给它下了第一单活
第一单活跟我自己有关:访问 computeforge.cn,预估它未来 1 到 10 年的流量。模型选了 deepseek-v4-flash,推理级别开到 high,任务丢进去,然后我看着它自己动。
它先 curl 首页、读了一遍 HTML 结构,然后去查域名的 whois 信息——这里就翻了个车:它先敲的是通用 IANA 的 whois 服务器,可 .cn 的注册信息从那儿查不对,它绕了一步才发现得换成 whois.cnnic.cn 重新查。接着解析域名,curl 回来的 IP 是 198.18.0.7 这种保留测试段,它一度以为站点解析坏了,在顾虑里来回绕了两下,最后自己确认是沙箱网络的问题才继续。之后它去翻了 sitemap、robots.txt、文章发布频率,收尾交上来一份一页纸的估算,附一张驱动流量的变量清单。
从 05:37:41 到 05:39:35,整个任务跑完用了 1 分 54 秒。全程我什么也没干,就在旁边看它一个接一个地点工具。
一个关键发现:右下角那个 Trajectory
凌晨被我忽略的那个入口,是我这周最大的一个收获。
它把刚才那次任务从头到尾每一步都记下来了——几点几分调了哪个工具、那个工具执行了几秒、中间改过哪个文件、返回了什么结果——二十多个步骤排成一条时间线摊在 Trajectory 面板里,点开其中一步,还能看到完整的工具请求和响应原文。这我没想到。我拿这个去 Claude Code 里翻了一圈设置,没找到对等的东西。说实话,就这一下,我对它整篇的看法都变了。
试了才知道的还不止这点:它连模型都能换,默认跑 deepseek-v4-flash,也接得上 OpenRouter 换别的厂商,并不绑死 DeepSeek 一家。

这一单的账单
2026 年 8 月 16 日,v0.1.0-rc.6,deepseek-v4-flash 高推理,跑完「预估 computeforge.cn 未来 1–10 年流量」耗时 1 分 54 秒,新生成的 token(输入+输出)约 2.3 万,折合 ¥0.2,按官方 API 计价估算。
算完这行我又顺手把这天早上五轮对话的总账拢了一遍:新 token 一共才 5.8 万,缓存读取却喝了 54 万。钱的去向,另说。
我还让它写了个 3D 小游戏
光看它查资料不过瘾,临睡前我又给它派了一单:写一个能玩的 3D 小游戏。它照旧先建项目、再写代码、跑起来、修 bug,中间还自己开终端装依赖。下图是跑起来的样子,人物能移动、有敌人有血量,还塞了个商店进去。放在专业游戏开发面前这个当然不值一提,但它是从头到尾自己做出来的,中间每一步都留在 Trajectory 里,我随时能回去逐段复盘。

最烦它的地方:记性太好,也有代价
那天早上我又连着派了几单——网站怎么盈利、sitemap 修好没有、本站那篇文章是不是 AI 写的。最让我想吐槽的正是这个流程暴露出来的毛病:每说一句新的话,它都把整场对话的历史原样端回去再读一遍。第三轮让它给盈利建议,那一轮缓存读取吃了 18 万 token;第四轮让它判断文章,直接飙到 24 万。到 07:52 收工,五轮下来缓存读取累计 54 万。我说句实话,一大半的钱烧在”回忆我们刚才聊了什么”上,而不是在干活。对话越长,这个毛病越明显,长任务跑久了上下文膨胀,又拖速度又烧钱。
和 Claude Code 比,就两句
跟 Claude Code 比,它赢在插件开放的彻底程度和执行轨迹的可观测性,输在成熟度和稳定性。就这两点,别的不用比。想要云电脑那一路走法的,可以对照着翻上一篇Grok Bot 评测。
谁适合,谁别碰
适合两类人:一是天天折腾 Agent、爱自己拼 Skill 和插件、受够了黑盒输出的开发者——它至少把每一步摊给你看;二是拿 DeepSeek 跑长任务的人,能换模型、能看轨迹,这两点对味。
别碰的人也别绕:只想让 AI 写两行代码就收工的,Claude Code 和 Codex 更省心;要靠它当生产主力、任务价值高到容不下一丝翻车的人,先等它把 Sub-agent 那几个已知问题修稳再说,别拿真项目给它练手。
就写到这
我把它留着了。这周末打算拿它真刀真枪修一个 computeforge 仓库里的 GitHub Issue,跑通了再回头写一篇跟进,把这套配置和这次的账单都算进去。





