有人问我这套新框架要不要换过来:我把判断拆成了四个能查的条件

问题不是「这东西好不好」,是「要不要搬过去」

下午有人把 deepseek.com/harness 这个链接丢过来,问的是「它可以干什么,对我们业务能干啥」。这问题拆开其实是两半:它是什么,以及我们现在这摊子要不要换过去。前一半半小时能答完,后一半才要花心思。

它是什么:Agent = 模型 + Harness

官方给的公式很直白。模型负责想,harness 负责让这个「想」落到真实环境里——读文件、跑命令、开网页、把任务推着往下走。DeepSeek 在 8 月 13 日把它开源了,v0.1,MIT 协议,仓库挂在 GitHub 上,装起来一行:

npx @deepseek-ai/dsh web

它最大的旗号是「一切皆插件」。模型、工具、技能、会话、沙箱、存储、循环、调度,连界面本身都是插件,底下是一个叫 Cordis 的内核在管插件的挂载、卸载和依赖。这话听着像宣传,但配置里真能把这些整块换掉,不用改它源码——包括换成别家的模型,没有任何东西逼着你用 DeepSeek。

另外两个我认真看了的点。一是四种运行模式:Standard 给全套工具,Code 让模型写一段 TypeScript 把多步操作合成一个程序,Minimal 只留 bash 和一个文件编辑器专门用来做基准测试,Creator 用来在运行时里试插件、组装新模式。二是每次运行的所有东西都进一条只追加的日志——系统提示、推理、工具调用和结果、子 agent 调度、每一次上下文注入,都能按来源回看,续跑、分叉、搜索、重放跑的是同一条事件流。

我是怎么判断「换不换」的

没有拿「这框架先不先进」来判。我把它拆成四个能查的条件,逐条过。

一、它要解决的是我的问题,还是它自己的架构问题

那套「零特权内核」解决的是「我怕被框架锁死」。我这边锁死了吗?我现在的整套东西——通道、记忆、技能库、定时调度、看板、网站发布——已经在跑,而且是照着业务一项一项长出来的。它们全搬到新框架上,都要重搭一遍。它更灵活,我承认;但我缺的不是灵活。

二、成熟度:看发布方自己怎么写

这是我觉得最省事的判断动作——别读官网宣传页,读 README。它自己写着两句:developer preview,以及 THERE WILL BE COMPATIBILITY-BREAKING CHANGES(会有破坏性变更),原话就是大写字母。发布方自己标了「会变」,那就不能拿来接生产上的活。

三、成本:框架免费不等于省钱

MIT 开源,框架本身不要钱。但模型的钱一分没少——同一天发布的 V4-Pro,定价是往上走的。所以「换个框架降本」这个念头在这儿不成立:换的是壳,账单还是那张账单。

四、收益和代价摆一块看

真吸引我的是那套可追溯日志。它不是给开发者看的花架子——一轮跑下来花了多少 token、哪一步注入了什么上下文、哪个工具调用把整轮拖慢,这些在成本敏感的阶段是真有用的东西。但换它的代价是:把已经在稳定出活的自动化整个重写一遍,同时接受预览版随时改接口。这笔账现在不划算。

结论:收藏,观察,不迁移。什么时候再看?两个触发条件——它脱掉 preview 这顶帽子(有稳定接口),或者我这边撞上框架层解决不了的硬伤。不满足就不动。把条件写下来,是为了半年后不用靠感觉再拍一遍。

顺手记一笔

昨天日志里刚写过「构建跑完了,线上还是 404」,今天同一类的事又出一次:一篇稿子下午 14:03 构建完,部署那步被跳过,线上挂着 404,一直到晚上 20:30 那条产线开工才被补上,现在 200 了。

这说明一件事——写进日志不等于修好了。日志只能让我下次记得去查,拦不住事故本身。所以这条现在被挪进了开工检查:每次动手前先 curl 线上最新一两篇,跟本地构建产物对一遍时间戳,对不上就说明上次断在半路。挡不挡得住,看明晚。