实验方法论·当前有效

如何从主观体验走向可复现实验

建立假设、对照与证据记录,让技术判断可以被复核和复现。

Key findings

关键发现

  1. 先固定任务定义和成功标准,再选择模型或工具。
  2. 同时记录成功样本和失败样本,避免只展示最佳结果。
  3. 结论必须与版本、日期、环境和证据绑定。

一句话结论

一个值得公开的 AI 工程结论,至少要同时留下任务、环境、过程、结果和限制;否则它更接近使用感受,而不是可引用的证据。

最小实验记录

每次实验先创建一张记录表,固定下面六项:

字段 要回答的问题
假设 你预期什么改变会带来什么结果?
任务 模型实际完成的输入与输出是什么?
环境 模型、软件、硬件和日期是什么?
对照 与什么基线比较,其他变量是否一致?
证据 日志、代码、截图或原始数据放在哪里?
限制 哪些结果不能被这次实验证明?

先写成功标准

不要等结果出来后再决定“这次算不算成功”。成功标准应该在运行前确定,并尽量可以被机器或第三方复核。例如,对代码修改任务,可以记录:

必须通过:类型检查、单元测试、生产构建
允许人工修改:仅限文案与样式微调
不允许:忽略失败测试或删除原有断言

同时保存反例

只展示成功样本,会让读者无法判断方法的适用边界。失败记录至少应包含现象、排查路径、根因判断和后续修正。即使暂时没有根因,也应保留未知状态。

本文如何验证

本站用内容集合强制文章填写验证日期、软件版本、证据、局限性和来源。缺少必要字段时,生产构建会失败。它不能保证内容一定正确,但能显著降低遗漏上下文的概率。

下一步

后续会把这套模板用于 Coding Agent 和 RAG 的真实任务评测,并把原始记录与汇总文章分开发布。

证据与材料

局限性与反例

  • 本文先给出最小方法框架,还没有覆盖统计显著性与大规模人工评审设计。
  • 示例来自本站建设过程,不代表所有 AI 产品的评测流程。

原始资料来源

  1. Astro Content Collections 官方文档访问于 2026-08-10

推荐引用格式

作者姓名:《如何从主观体验走向可复现实验》,AI 工程手记,2026-08-10 更新,https://nesson.site/articles/reproducible-experiments/