ai-research-explore

ai-research-explore

热门

与Rigor Explore兼容的技能标识,用于有意义且可能具有新颖性的深度学习研究候选方案。当研究者已选择任务族、数据集、基准、评估方法,提供SOTA参考,并希望在`current_research`基础上进行仅候选方案的探索,且要求可审计的仓库理解、想法筛选、公平比较以及将受控实验写入`explore_outputs/`时使用。不适用于以README为先的可信复现、开放式方向探索、狭窄的仅代码或仅运行探索、被动仓库分析、已验证的新颖性声明或隐式实验。

449Star
9Fork
更新于 2026/6/22
SKILL.md
只读
名称
ai-research-explore
描述

与Rigor Explore兼容的技能标识,用于有意义且可能具有新颖性的深度学习研究候选方案。当研究者已选择任务族、数据集、基准、评估方法,提供SOTA参考,并希望在`current_research`基础上进行仅候选方案的探索,且要求可审计的仓库理解、想法筛选、公平比较以及将受控实验写入`explore_outputs/`时使用。不适用于以README为先的可信复现、开放式方向探索、狭窄的仅代码或仅运行探索、被动仓库分析、已验证的新颖性声明或隐式实验。

ai-research-explore

目的

在研究者明确授权在持久的current_research锚点基础上进行仅候选方案的工作后,使用此与Rigor Explore兼容的技能标识。安装后的标识保持为ai-research-explore以确保兼容性。Rigor Explore用于有意义且可能具有新颖性的深度学习研究候选方案,同时保持科学严谨性、可比性、可复现性和可审计的协作。在文献对比、消融实验证据和公平比较之前,新颖性和显著性仍为假设。该技能不承诺自主发现、全局基准完整性、新颖性证明或可信复现成功。

../../references/agent-operating-principles.md中的共享操作原则开始,然后加载../../references/research-rigor-principles.md以了解研究声明,以及../../references/deep-learning-experiment-principles.md以了解实验细节影响可比性或可复现性的情况。

适用场景

仅当请求同时满足以下两个条件时使用此技能:

  • 明确的探索授权,例如仅候选方案工作、隔离分支或工作树、扫描、多个变体或探索性排序。
  • 持久的current_research上下文,例如分支、提交、检查点、运行记录或已训练的本地模型状态。

将狭窄的仅代码请求保留给explore-code。将狭窄的仅运行请求保留给explore-run。将被动仓库分析保留给analyze-project。将以README为先的复现保留给ai-research-reproduction

研究节奏

使用双循环节奏:

  • 外循环:理解仓库,冻结任务/数据集/评估/预算,保留用户想法,映射来源,筛选想法,并决定下一个实验是否值得运行。
  • 内循环:进行一次有边界的候选变更或运行,进行冒烟测试,收集证据,与当前锚点排序,然后停止或带着新证据返回外循环。

此节奏为指导,而非僵化的自主循环。在遇到明确障碍、科学意义不明确、预算耗尽、缺少锚点/评估或需要人工检查点时停止。

工作流程

  1. 确认current_research和明确的探索通道授权。
  2. 接受传统的variant_spec或更高级别的research_campaign
  3. 在活动模式下,在候选工作之前冻结任务、数据集、基准、评估来源、SOTA参考和预算。
  4. 仅构建当前活动所需的仓库理解工件,通常通过analyze-project完成。
  5. 当来源支持重要时,进行有边界、优先缓存的来源查找;优先使用本地策展文献(如Zotero),然后使用种子来源、仓库本地定位器、公共定位器或可选的网络查找。将查找视为来源解析,而非开放式的文献搜索。
  6. 保留研究者提供的想法,可选地添加一小部分有边界的单变量种子想法,并使用明确的筛选标准和分数分解对想法进行排序。
  7. 每次优先处理一个清晰的候选方案。使用explore-code进行有边界的代码适配,使用explore-run进行短周期试验或扫描。
  8. 仅当探索计划需要实际执行证据时,使用minimal-run-and-auditrun-train
  9. 将仅候选方案的输出写入analysis_outputs/sources/explore_outputs/;切勿将探索性收益呈现为可信复现成功。包括SCIENTIFIC_CHANGELOG.mdCOMPARABILITY_REPORT.md以说明候选方案的科学意义和比较边界。

排序与证据

  • 在执行前,根据预期收益、成本、成功可能性、补丁范围、依赖拖累、评估风险和回滚便利性对候选方案进行优先级排序。
  • 在执行后,首先根据实际证据排序:命令状态、观察到的指标、工件、更改的路径、冒烟测试结果和可复现性说明。
  • 保持研究者提供的evaluation_sourcesota_reference在活动期间冻结;不要声称它们是全局完整的。
  • 如果最佳想法过于接近或实现无法分解为可审计单元,则停止检查点,而不是默默选择。

活动输入

对于Rigor Explore活动,首选research_campaign,但应保持最小化。持久核心是:

  • current_research
  • task_family
  • dataset
  • benchmark
  • evaluation_source
  • sota_reference
  • compute_budget

candidate_ideasvariant_specresearch_lookupidea_policyidea_generationsource_constraintsfeasibility_policybaseline_gateexecution_policy作为可选指导,而非代理必须在每次活动中填写的字段。有关高级模式和工件期望,请参阅references/research-campaign-spec.md

参考加载

  • 加载references/ai-research-explore-policy.md以了解通道安全和候选语义。
  • 仅当活动文件存在或用户要求Rigor Explore活动治理时,加载references/research-campaign-spec.md
  • 加载../../references/explore-variant-spec.md以了解运行级变体矩阵细节。
  • 在做出新颖性、贡献、SOTA或可比性声明之前,加载../../references/research-rigor-principles.md
  • 当训练、评估、基线、消融、指标、检查点或数据集细节重要时,加载../../references/deep-learning-experiment-principles.md
  • 使用scripts/orchestrate_explore.pyscripts/write_outputs.py处理现有的确定性工件工作流。