开源有哪些工具可以帮助进行大模型需求分析的质量评估?
开源 Python 评测框架
1. RAGAS
最主流 RAG 评估库,专门评估检索 + 生成链路
内置指标:上下文召回、上下文精确率、忠实度(幻觉)、回答相关性。适合定位:检索漏业务约束、AI 编造业务规则。
可以自定义 LLM‑as‑Judge 打分 Prompt,实现需求业务维度打分(显性需求完整性、隐性需求合理性、待确认是否齐全)。
优点:无需大量标准答案,批量跑测试集,输出分数报表。
局限:原生没有产品需求分析维度,必须自己写 judge 提示词。
2. DeepEval
pytest 风格,可以嵌入 CI 流水线,支持自定义 G‑Eval 自定义打分维度。
可以自定义评测维度:业务目标准确性、显性需求无遗漏、幻觉风险、JSON格式合规。
每次修改 Prompt、切片策略,自动跑回归测试,防止版本退化。
适合:迭代优化 RAG+Prompt 时,自动化回归测试。
3. TruLens
链路追踪 + 评估仪表盘
完整记录整条链路:原始需求、RAG 召回切片、大模型输入、输出结果。
可视化看每一条 case:是检索错了,还是大模型生成出错。
适合排查问题:定位质量差是检索问题,还是 Prompt 问题。
小结:工程实践组合:RAGAS 做 RAG 基础指标 + DeepEval 自定义业务打分 + TruLens 做链路排查。