全部课程
动手做 · AI 应用 · 20 分钟

如何简单评估 AI 回答好不好?

Evals 入门:用几条测试挡住「翻车」。

进阶AI 应用

你将学会

  1. 评测是一份带期望性质的输入清单,每次改提示词都跑。
  2. 从表格里 20 行开始。你不需要一个平台。
  3. 打分打行为(引用、拒绝、格式),不打感觉(「听起来聪明」)。

能用的最小评测

列:编号、输入、期望(备注或原文)、必须包含、不得出现、通过/失败、笔记。二十行:12 条开心路径,5 条恶心(空、很长、找茬),3 条该拒绝。

  • 格式检查:合法 JSON、不超过 N 条、语言是中文。
  • 依据:每个断言有原话,或 UNKNOWN。
  • 安全 / 范围:拒绝医疗、法律、或不在语料。
  • 工作:人会复制这份输出。这是干完活评测。

没有团队怎么跑

第一周手跑(这是学习)。然后表格公式,再让 LLM 只评那些模糊行,并贴上评分标准。没有标准时,永远别让同一个模型给自己的诗打分。

建 20 行表

大约 30 分钟
  1. 用样例包里的真实输入写 20 条。
  2. 每条填必须包含 / 不得出现。
  3. 跑当前提示词。打分。不要边跑边改。
  4. 提示词只改一次。20 条全重跑。记下变化。

出门前核对

下一课
🎨 如何 vibe-code(边聊边写)?