编程能力排名是 claude fable5 > gpt sol extra > claude 4.8 吗?

发布于

blackantt:

看到说,规划用 claude ,代码用 gpt 。
那具体编码能力是 claude fable5 > gpt sol extra > claude 4.8 吗?

---

原文链接:[点击查看](https://www.v2ex.com/t/1229132)

评论(18)

我自己感觉 kimi 3 和 GLM 5.2 写代码比 GPT 要顺手,不过跟 Claude 比还是差了点。可以参考下这个编程能力榜单: https://arena.ai/leaderboard/code/webdev

· 0 个赞

回复

@mmdsun 你发的这个榜单感觉不太靠谱啊,这 kimi3 怎么都排到第 1 名了?

· 0 个赞

我也觉得,自己用下来的体感差不多就是这样。

· 0 个赞

自己上手用下来,感觉还真是这么个排序。

· 0 个赞

确实,claude 4.8 马上就快鸡肋得没法用了。

· 0 个赞

这种对比直接看榜单就行了,个人体感其实没啥意义。给你甩俩链接,自己对比下智能体和综合能力吧: https://arena.ai/leaderboard/agent

https://artificialanalysis.ai/models?intelligence=artificial-analysis-intelligence-index#intelligence

· 0 个赞

单纯比写代码的话,这个排名大差不差。但如果涉及到其他类型的任务,那排名可就不一定了。

· 0 个赞

我日常开发习惯拿 opus 和 gpt 互相交叉审查,体感就是 GPT 在代码细节上更靠谱些,而 opus 在把控整体架构上更胜一筹。

· 0 个赞

sol 写前端简直太拉胯了,我现在的套路是先让 Claude 把前端样式搞定,然后再丢给 sol 去改。

· 0 个赞

楼主我觉得看编程榜单得把“跑分成绩”和“实际工作流契合度”分开看。像前端优化、Code Review 质量、响应速度还有上下文处理这些因素,都会直接打乱纸面上的排名。这里丢个 Kimi K3 的跑分链接 https://kimi3.org/benchmarks/,大家可以参考下它跟 Claude、GPT 系的实际权衡。

· 0 个赞

如果是看大项目的编程能力,建议直接去瞅瞅 DeppSWE 这个测试: https://deepswe.datacurve.ai/

· 0 个赞

这事儿还得辩证地看👀,不过我自己目前还在接着用 gpt-5.5 呢哈哈哈。

· 0 个赞

感觉这种榜单迟早要被大伙玩坏,毕竟刷榜这事儿太常见了。上一个被搞臭的好像还是手机相机的评测排行榜吧?

· 0 个赞

我自己试下来,感觉 GLM 5.2 和 kimi 3 写代码比 GPT 好使,不过跟 Claude 比还是差了点。可以参考下这个编程榜单:https://arena.ai/leaderboard/code/webdev

· 0 个赞

回复

@mmdsun 感觉这个排行榜有点魔幻啊,kimi3 怎么冲到第 1 去了。

· 0 个赞

差不多,日常用下来的体感就是这样。

· 0 个赞

自己用下来确实差不多这个排序,体感没毛病。

· 0 个赞

claude 4.8 感觉快没法定下心来干活了,经常理解不到位。

· 0 个赞