[分享&&求赐教] 开源了一个对话 Agent 多维评测小框架,请教大家是怎样评估置信度以及提高评测正确率的?
最近在做带工具调用的对话 Agent,换 Prompt / 模型之后,经常不知道整体是变好了还是变差了。
网上那些大模型排行榜,多半在比「回答好不好看、聊起来顺不顺」;我想评的是另一件事:对着一次完整交互,看意图理解对不对、工具用得靠不靠谱、最终结果能不能用。于是搓了个轻量框架开源出来:
**GitHub:** [https://github.com/Bingo-choco/ai-evaluation](https://github.com/Bingo-choco/ai-evaluation)
## 大概长什么样
输入一份结构化交互日志(用户问题 + 中间过程 + 最终回复),输出三维分:
- 意图理解
- 工具调用
- 结果输出
0/1/2 + 简短理由;不好的样本会打问题标签。前端可以上传批次、看进度和聚合结果,也能导出。
链路很短(LangGraph,共享状态,不是 Agent 互聊):
```
解析 → 规则短路 → 相似样本召回(few-shot) → 拼 Prompt → 压缩(防超 token) → 多路打分合并 → 置信度/聚合
```
硬错误走规则,能短路就不用调 LLM;拿不准的再交给多路 Judge 投票。
## 优点 / 缺点(实话)
**还行的地方:** 省一点评测成本;有 few-shot 对齐口径;打完分还有简单置信度自检。
**不行的地方:** 本质还是 LLM 当裁判,会漂;规则和语义有时打架;工程还比较糙。
## 想请教
你们线上怎么保障对话 / 工具型 Agent 的质量?怎样去评估这个评测结果的可信性以及提高可信性
纯规则断言、LLM-as-Judge、人工抽检,还是 Langfuse / DeepEval 之类?有没有比较省事的组合,求轻喷。
---
原文链接:[点击查看](https://www.v2ex.com/t/1233918)
网上那些大模型排行榜,多半在比「回答好不好看、聊起来顺不顺」;我想评的是另一件事:对着一次完整交互,看意图理解对不对、工具用得靠不靠谱、最终结果能不能用。于是搓了个轻量框架开源出来:
**GitHub:** [https://github.com/Bingo-choco/ai-evaluation](https://github.com/Bingo-choco/ai-evaluation)
## 大概长什么样
输入一份结构化交互日志(用户问题 + 中间过程 + 最终回复),输出三维分:
- 意图理解
- 工具调用
- 结果输出
0/1/2 + 简短理由;不好的样本会打问题标签。前端可以上传批次、看进度和聚合结果,也能导出。
链路很短(LangGraph,共享状态,不是 Agent 互聊):
```
解析 → 规则短路 → 相似样本召回(few-shot) → 拼 Prompt → 压缩(防超 token) → 多路打分合并 → 置信度/聚合
```
硬错误走规则,能短路就不用调 LLM;拿不准的再交给多路 Judge 投票。
## 优点 / 缺点(实话)
**还行的地方:** 省一点评测成本;有 few-shot 对齐口径;打完分还有简单置信度自检。
**不行的地方:** 本质还是 LLM 当裁判,会漂;规则和语义有时打架;工程还比较糙。
## 想请教
你们线上怎么保障对话 / 工具型 Agent 的质量?怎样去评估这个评测结果的可信性以及提高可信性
纯规则断言、LLM-as-Judge、人工抽检,还是 Langfuse / DeepEval 之类?有没有比较省事的组合,求轻喷。
---
原文链接:[点击查看](https://www.v2ex.com/t/1233918)
评论
暂无评论。