DSH 不同模式下 V4 Pro + Max 制作小游戏的真实效果
fanmoshu233:
看到很多平台都在聊 DSH 搭配 V4 Pro (with max reasoning effort) 正式版使用时,不同的模式间思维链和产品效果存在较大差异,于是花了 20 多块实测了几轮较简单的任务,也搭配 Pi Native 模式作为对照,供参考。
测试除 Pi 对照之外,都在 DSH 中使用 DeepSeek V4 Pro max 推理强度进行。
**Prompt:** “复刻超级马里奥”
**实测效果:** [https://deepseek-v4-harness.pages.dev/](https://deepseek-v4-harness.pages.dev/)
个人看来,“We need” “Let me” 这两种思维链间的差异确实挺大的(链接里标准模式和 Pi 对照组里的有些简直没法玩),目前好像还没有其他企业部署开源权重的 v4p,不确定是官方动了手脚还是模型本身注意力等存在问题。
用 DSH 并且想发挥 v4p 最佳实力的话,还是建议用极简模式。网上也有人做了标准/PTC 模式伪装极简模式实现 We need 思维链,但是这里没有测试。
---
原文链接:[点击查看](https://www.v2ex.com/t/1234586)
看到很多平台都在聊 DSH 搭配 V4 Pro (with max reasoning effort) 正式版使用时,不同的模式间思维链和产品效果存在较大差异,于是花了 20 多块实测了几轮较简单的任务,也搭配 Pi Native 模式作为对照,供参考。
测试除 Pi 对照之外,都在 DSH 中使用 DeepSeek V4 Pro max 推理强度进行。
**Prompt:** “复刻超级马里奥”
**实测效果:** [https://deepseek-v4-harness.pages.dev/](https://deepseek-v4-harness.pages.dev/)
个人看来,“We need” “Let me” 这两种思维链间的差异确实挺大的(链接里标准模式和 Pi 对照组里的有些简直没法玩),目前好像还没有其他企业部署开源权重的 v4p,不确定是官方动了手脚还是模型本身注意力等存在问题。
用 DSH 并且想发挥 v4p 最佳实力的话,还是建议用极简模式。网上也有人做了标准/PTC 模式伪装极简模式实现 We need 思维链,但是这里没有测试。
---
原文链接:[点击查看](https://www.v2ex.com/t/1234586)
· 0 个赞