ai-research-reproduction

ai-research-reproduction

热门

与 Rigor Reproduce 兼容的技能标识符,用于以 README 为先的深度学习仓库复现。当用户需要端到端、最小可信流程时使用,该流程首先读取仓库,选择最小的文档化推理或评估目标,协调代码获取、环境设置、可信执行、可选的可信训练、可选的仓库分析以及可选的论文差距解决,强制执行保守的补丁规则,记录证据、假设、偏差和人工决策点,并写入标准化的 `repro_outputs/` 包。不用于论文摘要、通用环境设置、孤立的仓库扫描、独立的命令执行、静默协议更改、分数追逐或仓库基础复现之外的广泛研究协助。

443Star
9Fork
更新于 2026/6/21
SKILL.md
readonly只读
name
ai-research-reproduction
description

与 Rigor Reproduce 兼容的技能标识符,用于以 README 为先的深度学习仓库复现。当用户需要端到端、最小可信流程时使用,该流程首先读取仓库,选择最小的文档化推理或评估目标,协调代码获取、环境设置、可信执行、可选的可信训练、可选的仓库分析以及可选的论文差距解决,强制执行保守的补丁规则,记录证据、假设、偏差和人工决策点,并写入标准化的 `repro_outputs/` 包。不用于论文摘要、通用环境设置、孤立的仓库扫描、独立的命令执行、静默协议更改、分数追逐或仓库基础复现之外的广泛研究协助。

ai-research-reproduction

目的

将此作为与 Rigor Reproduce 兼容的技能标识符,用于以 README 为先的深度学习仓库复现。安装后的标识符保持为 ai-research-reproduction 以确保兼容性。该技能引导智能体进行最小可信运行并提供可审计的证据;它不应微观管理模型可以从仓库推断出的实现细节。复现不是“通过更改任何东西来使其运行”;而是忠实地读取 README、环境、权重、数据集和文档化命令,然后记录结果和偏差。

从共享的操作原则 ../../references/agent-operating-principles.md 开始,然后在涉及科学意义、可比性或实验细节时加载 ../../references/research-rigor-principles.md../../references/deep-learning-experiment-principles.md

适用场景

当以下所有条件成立时使用此技能:

  • 目标是一个 AI 代码仓库,包含 README、脚本、配置或文档化命令。
  • 请求涉及多个可信阶段,如代码获取、设置、执行、训练验证、分析、论文差距解决和报告。
  • 期望的结果是一个小的可复现目标,而不是广泛的实验。

不要将此技能用于论文摘要、通用环境设置、孤立的仓库扫描、独立的命令执行、开放的研究设计或仅限候选方案的探索。

可信目标选择

选择能够诚实展示仓库基础复现的最小目标:

  1. 文档化的推理
  2. 文档化的评估
  3. 文档化的训练启动或部分验证
  4. 仅在用户明确确认后进行完整训练

将 README 指导视为主要的复现意图。使用仓库文件来澄清 README,而不是静默替换它。当 README 和论文冲突时,记录冲突,并仅针对狭窄的复现关键差距使用 paper-context-resolver

工作流程

  1. 读取 README 和附近的仓库信号。
  2. 使用 repo-intake-and-plan 提取文档化命令和候选目标。
  3. 选择并证明最小可信目标的合理性。
  4. 仅针对目标特定的环境、检查点、数据集和缓存假设使用 env-and-assets-bootstrap
  5. 仅在需要只读澄清结构、插入点或可疑实现模式时使用 analyze-project
  6. 使用 minimal-run-and-audit 进行文档化的推理、评估、冒烟或健全性执行。
  7. 当选择的可信目标是训练启动、短运行验证、完整启动或恢复时,使用 run-train
  8. 在更完整的训练声明或任何可能改变数据集、划分、检查点、预处理、指标、损失、模型语义或结果解释的更改之前,暂停等待人工审查。
  9. 编写标准化输出,并在可行时用用户的语言给出简洁的最终说明。

补丁边界

优先不编辑仓库。如果需要编辑,保持保守和可审计:

  • 在代码更改之前,尝试命令行参数、环境变量、路径修复、依赖版本修复或依赖文件修复。
  • 必要时允许复现修复,但不得隐藏。说明更改了什么、为什么必要、是否改变了科学意义、以及是否影响与论文、README 或基线的可比性。
  • 避免更改模型架构、核心推理语义、训练逻辑、损失函数或实验意义。
  • 如果必须更改仓库文件,创建一个名为 repro/YYYY-MM-DD-short-task 的分支,保持已验证的补丁提交稀疏,并在 PATCHES.md 中记录对 README 保真度的影响。

参见 references/patch-policy.md

输出

始终以 repro_outputs/ 为目标:

SUMMARY.md
COMMANDS.md
LOG.md
SCIENTIFIC_CHANGELOG.md
COMPARABILITY_REPORT.md
status.json
PATCHES.md   # 仅当应用了补丁时

使用 assets/ 下的模板和 references/output-spec.md 中的字段规则。

  • 将最短的高价值摘要放入 SUMMARY.md
  • 将可复制的命令放入 COMMANDS.md
  • 将过程证据、假设、失败和决策放入 LOG.md
  • 将科学意义和更改效果放入 SCIENTIFIC_CHANGELOG.md
  • 将比较锚点和协议偏差放入 COMPARABILITY_REPORT.md
  • 将持久的机器可读状态放入 status.json
  • 在需要时将分支、提交、验证和 README 保真度影响放入 PATCHES.md
  • 区分已验证的事实和推断的猜测。

参考加载

  • 在编写人类可读输出时加载 references/language-policy.md
  • 在做出可比性、贡献或研究结果声明之前加载 ../../references/research-rigor-principles.md
  • 当数据集、划分、指标、检查点、训练或评估细节重要时加载 ../../references/deep-learning-experiment-principles.md
  • 在协议敏感决策之前加载 references/research-safety-principles.md
  • 在修改仓库文件之前加载 references/patch-policy.md
  • 将专门逻辑保留在子技能、脚本、模板或参考中,而不是扩展此入口点。