选择模型时,团队常会先比较排行榜、上下文长度和价格。这些信息适合做第一轮筛选,但到了合同审核、客服回复或设备诊断等具体场景,榜单名次很难直接预测结果。

业务问题有自己的词汇、规则和错误成本。模型在百科问答中表现很好,不代表它能识别一份内部制度的版本冲突。

把日常任务变成评测集

有效的评测题目应来自真实工作。可以从历史工单、常见提问和人工修正记录中整理任务,再去除敏感信息。题目要覆盖正常情况,也要保留资料不足、要求含糊和规则冲突的情况。

标准答案不一定只有一句话。对需要判断的任务,可以写清必须提到的事实、不可做出的承诺,以及什么条件下应转交人工。

评测的价值在于提前看见错误会怎样发生,而不只是给模型排出先后。

正确一次还不够

同一问题多次运行,结果是否稳定,往往比偶尔得到一个精彩答案更重要。团队还要观察模型换一种表达后是否误解问题,长对话中会不会忘记关键限制。

拒答也属于能力。面对缺少依据的提问,明确说明无法判断,比拼凑一个流畅结论更可靠。

记录人工修正成本

两个模型的正确率接近,人工处理方式可能完全不同。一个答案只需补充来源,另一个需要重写全部逻辑。评测应记录修正时间和错误严重程度,而不只计算命中数量。

模型升级后,用同一批核心任务回归测试,才能知道变化对业务是帮助还是干扰。榜单会继续更新,企业自己的评测集才是长期资产。