一、基础能力指标
多用于模型选型、微调前后对比
知识问答:C-Eval、MMLU(通识、学科知识)
逻辑推理:GSM8K(数学推理)、BBH、ReClor(逻辑阅读理解)
代码能力:HumanEval、MBPP(代码生成通过率 Pass@k)
中文理解:CMMLU
事实真实性:TruthfulQA(衡量幻觉程度)
输出形式:正确率、通过率
二、生成质量核心指标
1. 客观自动指标
BLEU / ROUGE:文本相似度,适合摘要、翻译;缺点:只匹配文字,不能判断逻辑对错
BERTScore:基于语义相似度,比 ROUGE 更适合中文
Exact Match(EM)、F1:简答、抽取类任务
局限:开放式创作(写文案、方案)不适合只用这类指标。
2. LLM-as-Judge 模型互评指标(主流方案)
让评判大模型打分,常见评估维度:
指令遵循度:是否完整满足 prompt 要求、遵守格式、角色设定
相关性:回答是否贴合问题,有无答非所问
事实准确性(幻觉):是否编造不存在人物、数据、文献
逻辑性:前后是否自相矛盾、推导合理
完整性:有无遗漏关键信息
简洁性 / 冗余度:是否废话过多
3. 人工主观打分(MT-Bench 模式,1~5 分制)
维度同上,常用于自动化指标无法覆盖的场景。
三、一致性指标
单轮一致性:相同 Prompt 多次请求,输出稳定程度
多轮对话一致性:长对话中模型信息不自相矛盾
鲁棒一致性:同义不同表述的 prompt,答案趋向统一
四、安全与对齐指标
拒答率:面对违规问题能否正确拒绝输出有害内容
越狱抵抗能力:各类诱导 prompt(角色扮演、编码绕过)下是否失守
偏见与歧视:性别、地域、人群相关问题有无不当观点
隐私泄露风险:是否输出训练数据内敏感信息
五、性能 & 工程指标
首包时延 (TTFT):首个字符返回时间(流式输出关键)
总响应时延
吞吐 Tokens/s:每秒生成 token 数量
并发支持数
GPU 显存 / 内存占用、CPU 负载
错误率:API 报错、超时、上下文超限
六、RAG/Agent 应用层特有指标
如果不是裸模型,而是知识库问答系统,额外测:
检索召回准确率:是否召回相关文档
引用保真度:模型生成内容是否和检索文档一致,不凭空编造
引用溯源正确性
工具调用成功率(Agent):正确判断何时调用工具、参数是否正确