任务完成后只留下一个结果压缩包,短期看似省事,几个月后却没人知道它使用哪版数据、哪个脚本和哪些参数。可复查记录的价值,在于让结果仍能被解释,而不是无限保存所有临时文件。
记录任务身份
每次正式运行使用唯一任务编号、标题、负责人和日期。
任务编号连接日志、输出和项目讨论。
失败重试使用新的运行编号并关联原任务。
编号本身不能说明结果质量。
保存输入清单
列出文件、来源、版本、大小和可信校验值。
受限数据只记录受控位置,不复制到公开文档。
输入变化时生成新清单,不覆盖旧版本。
下载日期不能替代数据发布版本。
锁定环境与参数
保存操作系统、语言、包、容器和参考数据版本。
命令参数进入机器可读配置,并附简短解释。
秘密通过安全渠道注入,不写进日志。
相同环境也不能消除随机性和硬件差异。
区分标准输出与结果摘要
原始日志用于定位过程,摘要用于说明完成状态与主要产物。
日志保留退出码、警告和资源峰值。
摘要写明成功、部分成功或失败,不隐藏缺失子任务。
日志很长不代表记录完整。
把限制写在结果旁边
样本量、批次、缺失字段和模型假设会限制解释。
限制与结果放在同一版本,避免传播中被遗漏。
后续验证计划单独列出负责人和条件。
限制不是免责声明装饰,而是结论的一部分。
设置归档与复核日期
项目结束后决定哪些内容长期保留、哪些可重建。
归档后由另一位成员打开索引和代表结果。
设置未来复核日期,检查链接、环境和权限是否仍有效。
保存期限服从数据许可、伦理与组织制度。
本文参考资料
- NIST:可复现计算研究
- Bioconductor
- Kubernetes:管理计算资源
资料名称仅用于说明本文查阅范围,页面暂不提供外部链接。