OmniTools 9月3日消息,Google AI 团队近日公开一份技术教程,系统阐述如何为 LLM-as-a-Judge 场景设计可靠的布尔式评分标准。教程指出,模糊或宽泛的提示易导致评估结果不一致,并增加 token 消耗。
文中提出四条核心实践原则:一是将评判问题拆解为原子化、互不重叠的单元;二是限定模型仅评估可验证的客观事实,推荐使用 RFC 2119 规范术语(如 MUST、SHOULD)明确要求;三是严格限定评判范围,仅覆盖 prompt 中显式指定的内容;四是借助专家标注的 golden set 对评判模型持续校准,直至其评分与人类评估结果高度一致。