做 DeepSeek Agent 近一个月,同步下 Orca 的进展

发布于

echoVic:

上个月发帖说要做一个 DeepSeek-Native 的 Agent ( Orca ) [https://www.v2ex.com/t/1222331](https://www.v2ex.com/t/1222331)。

差不多块一个月了,来给 V 友们同步下进展:

这一个月 880 多个提交,Rust 从 3.9 万行涨到 18 万行,代码全部是 codex 、claude code 和 orca 自己写的。我的工作只有两件:提需求和定质量门禁。

先说门禁:

- 2300+ 个测试,其中 20 个契约测试套件,把 agent loop 、审批、provider 、shell 会话、子代理、workflow 这些边界锁死
- 需求先落 spec 再落 plan 才准动手,目前攒了 25 篇设计、60 篇实施计划
- 223 篇 release note ,204 篇带可复现的验证命令,有的直接附 TDD 红绿证据
- 发布链路:fmt / clippy -D warnings / 全量测试 → 四平台构建 → npm staging 冒烟 → 发布 → 发布后从 npm 和 GitHub 拉真实产物装上再跑一遍 → 真实 DeepSeek API 的端到端 gate

所以我不需要再盯着 agent 写代码,提了需求开 goal 模式直接做任务就好。为此我还做了一个多 agent 协同基座,这个后面有时间可以开源。一个旁证:这个月 refactor 提交( 335 个)比 feat ( 182 个)还多——债是它自己主动还的。

我一直围绕全放手、自动化跑任务这个目标,通过这套流程来迭代,主要做了:

- OS 级沙箱:Linux 优先 bwrap 隔离,降级 Landlock + seccomp ,都没有就拒绝执行,绝不裸跑; macOS 走 Seatbelt
- 陌生仓库默认只读断网,项目配置 / [AGENTS.md](http://agents.md/) / skills 全不加载,/trust 之后才放行
- 每个工具调用恰好一个终态,被打断的、状态不明的如实记录,续跑不会把"没跑完"当"跑完了"
- goal 模式去掉轮数上限,换成停滞检测 + token 预算;报"完成"前必须真调过工具
- 跑着的任务丢后台,随便开新对话,要审批弹回来,重启能恢复

终端交互单独算一条线:145 个提交,TUI 从 8 千行到 2.8 万行。历史和实时视图分离(终端原生滚动)、鼠标选择 + OSC52 复制、任务面板、内联 diff 、上下文水位和压缩过程全程可见。长会话上万行 transcript 的场景下,滚动响应从 4s 优化到 5ms 左右。

接下来继续打磨 runtime ,然后做 Windows 。

上个帖子评论区争过 harness 有没有价值。这次不辩了,这个帖子就是我的答案:模型负责写,harness 负责让我敢信它写的东西。

GitHub:[github.com/echoVic/blade-deepseek](http://github.com/echoVic/blade-deepseek)

npm:`npm install -g @blade-ai/orca`

官网:orcaagent.dev

---

原文链接:[点击查看](https://www.v2ex.com/t/1228000)

评论(17)

比较好奇搞这波东西一共烧了多少钱?

· 0 个赞

回复

上个月光家里那台机器就跑了 200 多亿 token。

· 0 个赞

其实关键不是否认 harness(测试套件/框架)的价值,而是该探讨怎么做才是真正有价值的 harness。得衡量每一个机制和改动对最终产出到底是正反馈还是副作用,费效比究竟是涨了还是跌了。

· 0 个赞

回复

确实是这样,所以在研发流程上我采取了“质量门禁先行”的策略,之后再去丰富功能。在 Agent 设计的闭环里,必须有验证机制来兜底。

· 0 个赞

看到名字我还以为是那个 orca ( https://www.onorca.dev/ ) 呢。

· 0 个赞

DeepSeek 官方应该自己也在做 Agent 了吧,大家现在搞第三方的还有搞头吗?比如之前那个 reasonix 也是类似的情况。

· 0 个赞

回复

其实这项目动手比较早,那会儿 DeepSeek 还没像现在这样铺天盖地的。换个角度看,我主要也是想借这个机会,验证一下自己这套全流程自动化的研发模式行不行得通。

· 0 个赞

楼主别光顾着说提交量和测试用例呀,能不能发点实际的 benchmark 对比数据?比如任务完成率之类的。还是说你发这个帖子单纯只是为了记录一下从头开发 Agent 的过程?

· 0 个赞

回复

目前确实还没有跑过 benchmark,主要是像 SWE-bench 这类标准测试集,不太适合 Orca 这种设定目标后跑几十轮的场景。不过近期收到不少用户反馈说比 codewhale 好用,我觉得这比单纯跑分更有参考价值。也欢迎你来试试,有具体的对比场景咱们可以交流下。

· 0 个赞

深有同感,尤其是开新项目的时候,只要把基准和规则底线定好,剩下交给 AI 去执行,最终产出的代码质量甚至比我亲手写的还要好。

· 0 个赞

我也在搞个类似的开源项目( github.com/usewhale/whale )。说实话,自己弄这种项目要是没能把社区氛围带起来、形成正反馈,真的很容易半途而废。楼主加油!

· 0 个赞

回复

是的,做开源确实容易遇到这种瓶颈,咱们一起努力吧!

· 0 个赞

有个隐患是,官方在训练模型时,可能会直接用他们 harness 的静态提示词做 SFT。这点上第三方工具去对拼确实挺吃亏的。

· 0 个赞

回复

虽然大趋势上 Agent 迟早会被各大模型厂商垄断,但等官方方案出来再看吧,只要做得好,第三方依然会有自己的生存空间。

· 0 个赞

runtime 层的架构设计确实是核心,把工具、技能、Prompt 组装、审批机制以及大小循环这些统筹好能省去很多麻烦。Rust 确实是目前的版本答案。祝项目早日完工。

· 0 个赞

@sentinelK 嗯嗯,所以在研发流程中,我是质量把关先行,然后再开始开发。代理的设计中必须要有验证环节。

· 0 个赞

问题关键不在于否定 harness 的价值,而是怎么才能做出更有价值的 harness。需要权衡各项机制和变化对最终结果的影响,包括提高效果和提升价值的效率。非常重要。

· 0 个赞