这两天总算是体感了一下 chatgpt(codex)和 workbuddy 之间的差别

发布于

starwishzzgg:

想做一个武侠游戏,准备先收集整理一下金庸相关的武侠作品内容,包括门派、人物、武功等,并且根据关联关系建立武侠知识图谱,为后面做游戏做些准备,于是先用 ChatGPT 来干,活又细又慢,耗掉了我 5 个 plus 的重置,基本形成了一个数据基础,基于此生成了一个网页来查看相关关系和具体细节,我把我最熟悉的相关门派、人物、武功都看了一遍,除了有缺失的,基本没有错误。

忽然突发奇想,反正 workbuddy 也有之前薅羊毛来的几千积分,想对比一下区别,于是乎用同样的提示词输入 workbuddy,惊喜的是速度比 ChatGPT 快几倍,过程中观察发现比 ChatGPT 少了不少交叉比对来验证数据结果的正确性,结束后也生成了一个网页来查看关系和细节描述,同样去看我最熟悉的相关门派、人物、武功,发现了近 10 处细节错误。

从过程差异来看,感觉模型处理这样的任务差异不大,似乎主要就是缺在交叉验证数据结果这块,侧面思考一下,各个 agent app 的 harness 设计还是非常重要啊。

---

原文链接:[点击查看](https://www.v2ex.com/t/1229715)

评论

暂无评论。