首页 新闻 会员 周边

大模型 agent rag 真实的评测流程求

0
[待解决问题]

agent和rag评测 求 学,急急急!!!!!!!!!!

坚强的贝吉塔的主页 坚强的贝吉塔 | 菜鸟二级 | 园豆:202
提问于:2026-04-17 11:00
< >
分享
所有回答(3)
0

你是要做学术类的 Benchmark 跑分,还是针对具体业务场景的端到端评测?RAG 目前主流用 RAGAs 框架,Agent 重点看 Tool Use 和逻辑链条,我这有现成的评测维度表和自动化工具栈,你要哪种?

loveme2 | 园豆:180 (初学一级) | 2026-04-19 07:08
0

一、实操建议(急用的话照着做)
如果想快速上手RAG评测:
1.准备100-500条问答对作为测试集
2.用RAGAS框架一键跑分(支持中文)
3.重点关注忠实度和答案相关性两个指标
如果想快速上手Agent 评测:
1.先定义10-20个典型任务场景(如"帮我查天气并写入备忘录")
2.人工执行一遍,记录“正确步骤”
3.让Agent跑一遍,对比步骤和结果
4.计算任务成功率=成功任务数/总任务数
二、推荐学习资料
RAGAS 官方文档:https://docs.ragas.io/
AgentBench GitHub: https://github.com/THUDM/AgentBench
伯克利函数调用榜单:https://gorilla.cs.berkeley.edu/leaderboard.html

叛逆的小姐姐 | 园豆:202 (菜鸟二级) | 2026-04-21 09:29
0

前面两位说的框架都对,补充几个实际落地中容易被忽略的点:

RAG评测最大的坑是测试集质量。100-500条问答对听起来不多,但构建高质量测试集本身就是工程难题。建议按问题类型分层:事实查询类、推理类、多跳推理类、拒答类(答案不在知识库中),每类至少30条。拒答类尤其重要——很多RAG系统在知识库没有答案时会编造,忠实度指标就是抓这个的。

Agent评测比RAG复杂得多,因为执行路径不唯一。同一个任务可以有多种正确完成方式,简单的步骤对比会误判。更靠谱的做法是用LLM-as-judge做结果评估,而不是过程评估。用GPT-4或Claude当裁判,给Agent的输出打分,比人工对比步骤效率高很多。

另外推荐两个工具:TruLens适合做RAG的持续监控,能在生产环境追踪每次检索的质量;DeepEval是pytest风格的评测框架,适合集成到CI/CD里做回归测试。

badhope33834 | 园豆:276 (菜鸟二级) | 2026-09-15 08:25
清除回答草稿
   您需要登录以后才能回答,未注册用户请先注册