AI4S保证可复现,须固定数据版本、模型版本、参数、环境和随机种子,并保存工作流。AI给出的假说或分析必须用独立实验、公开基准或人工复核验证,不能把一次生成结果当成科学发现。
AI4S如何保证结果可复现?
AI4S保证结果可复现,不是把一次流畅生成写成发现,而是让他人按同一说明重复关键步骤。正确做法是给数据、代码、模型和实验记录编号,固定数据版本、模型版本、参数、环境和随机种子,每次工作流运行都导出可下载的参数与日志,并把关键任务与基线方法对比、报告差异。分析环境必须可重建,生产数据只有授权成员能改。AI给出的假说或分析,须用独立实验、公开基准或人工复核验证后才能改状态;论文投稿材料要与平台记录交叉核对。AI输出与验证结果分开存放。
定义:AI4S里的可复现到底指什么
在高校科研语境里,AI4S结果可复现是指:另一名授权研究人员,拿到指定数据版本、模型或工具版本、参数、环境说明和随机种子后,能够按复现操作说明重跑关键步骤,并判断输出与原报告是一致、落在约定误差带,还是因未记录因素失败。它回答的是“这次结果能不能被别人按同一条件检查”,而不是“对话框里这次答得是否漂亮”。平台层面,院系可用AI4S科学智能科研创新平台保存数据卡、工作流日志和验证状态,但可复现是否成立,仍由学科方法决定。
可复现包含三层,不能互相顶替。第一层是计算可重跑:同一划分、同一脚本或工作流、同一依赖,能再次产生对照表或中间产物。第二层是证据可回看:每张图、每个抽取字段、每条引用能回到数据卡、原文坐标或仪器记录。第三层是结论可核验:假说、拟合或综述判断经过独立实验、公开或组内基准、或人工复核,状态从候选改为已核验或已拒绝。只有第一层而没有后两层,只是“程序能再走一遍”;只有第三层的口头保证而没有前两层,别人无法检查你如何得到数字。
它与“可重复实验”也要分开说。实验科学里,独立实验往往换批次、换样品或换操作者,用来检验现象是否稳健。AI4S里的工作流复现,首先保证同一数字管道可被重跑和审计;独立实验、公开基准或人工复核,才用来决定候选结果能不能升级为可引用结论。建设顺序应先能重跑,再谈发现。平台怎么从可验证任务建起,见AI4S怎么建设;从论文里抽出的实验字段如何定位和人工确认,见AI如何提取科研论文中的实验数据。
它不是什么
- 它不是把聊天记录截图附在论文补充材料里就完成复现。
- 它不是只固定一个随机种子,却不记录数据切片、库版本和调用的工具。
- 它不是用“最新大模型”作为方法描述;没有名称和版本的模型无法重跑。
- 它不是把生产原始数据开放给所有人改写,然后指望分析环境还能对上历史图。
- 它也不是用更高的生成流畅度代替基线对比表。
因此,可复现首先是一套记录和权限纪律,其次才是软件功能。课题组如果不能给数据集、代码、模型和实验记录编号,后面所有“智能分析”都会在换人、换机器或投稿补材料时断裂。更短的对照摘要见高校AI智库 · 可复现专题。
为什么必须把可复现写成建设条件
学校把科学智能写进平台立项时,真正会在一年后出事的,通常不是界面不够新,而是四类同时出现的科研管理问题。
第一,结果无法被第二个人检查。研究生用个人笔记本跑完特征筛选,导师只看到一张最优曲线;半年后换机器、换库版本或换提示词,数字对不上,也说不清当时用了哪份表。评阅人、伦理审查或合作企业一旦要求“按原文重做关键步骤”,课题组只能重新猜测。可复现的最低标准是:别人按同一编号能判断这次运行是更好、更差还是无效,而不是听操作者回忆。
第二,生成内容与实验记录混在一个文件夹。模型摘要、工具返回的数值、人工改过的表格如果没有状态字段,投稿时极容易把候选写成结论。期刊和学校学术规范越来越要求披露人工智能使用范围;披露若对不上平台运行编号,等于无法自证。把AI输出和验证结果分开存放,不是形式主义,是为了让“尚未核验”四个字在系统里跑不掉。
第三,数据被改写后图表失去血缘。未发表光谱、测序、中试曲线若存在可覆盖的共享盘,任何人的一次另存为都会让历史分析无法解释。可复现要求生产数据只有授权成员能改,且每次改动生成新版本;分析侧挂载只读快照。没有这道闸,工作流日志写得再全,也只是精确记录了一次无法回看的错误输入。
第四,采购和验收被演示绑架。方案若只写“具备智能分析、自动发现、一键出图”,交付时只能看对话是否流畅。学校需要的是可测试条目:他人按说明能重复关键步骤、随机性被记录、结论有验证状态。把可复现写成建设条件,是为了不让“科学智能”退化成无法核验的生成表演。
实践中还有三类偏差,立项会就应排除。一是把公开网页上的一次问答当成方法学贡献,不建基准集。二是抽取论文表格后直接进分析库,不保留坐标和核验人,细节应回到实验数据抽取规范。三是用教学课的通识算力池跑未分级科研任务,环境每天被重置,日志无法对应课题。纠正这些偏差,不需要先承诺更大模型,需要先补编号、日志和验证状态。
五步保障:从编号到投稿交叉核对
第一步:给数据集、代码、模型和实验记录编号
没有稳定标识,后面所有“固定版本”都是空话。建议最少四类对象各有不可复用的编号:数据集或数据卡、分析代码或工作流定义、模型或工具版本、实验记录或运行实例。编号规则由课题组与信息化共同维护,写入文件名之外的元数据,避免只靠桌面文件夹排序。数据卡写来源、许可、采集条件、缺失、用途和责任人;模型或工具卡写名称、量化或接口、许可证、是否允许出域。实验记录编号必须能一对一指向某次运行,而不是“本周的分析”。
第二步:工作流每次运行都导出可下载的参数和日志
对话可以用来探索,正式分析必须走工作流。一次运行结束,至少导出:输入数据版本、工具调用顺序、参数、随机种子、开始与结束时间、操作者、中间产物路径、失败与重试。日志要能下载,不能只留在厂商后台。若步骤里包含论文实验数据抽取,日志还须带字段字典版本、原文定位和核验状态,方法见实验数据抽取指南。探索性对话若后面被引用,应补一次“升格运行”,把当时的提示词和材料固化进工作流,禁止用不可重放的聊天顶替。
第三步:关键任务与基线方法对比并报告差异
可复现不是自说自话的精度。对分类、回归、检索、抽取或流程耗时,都要先写下既有基线:人工流程、经典算法或上一版本工作流。对比时固定划分和指标,报告差异方向和失败案例,而不是只贴最好一次的生成图。没有基线的“提升”,在复现检查里通常无法成立,因为检查者不知道对照什么。
第四步:生产数据受限修改,分析环境可重建
两句话必须同时成立。生产库或原始文件只允许授权成员按变更单修改,历史版本不可覆盖;分析环境用镜像、依赖锁定文件和只读挂载重建。复现人员申请到的是指定快照,而不是“当前最新共享盘”。环境说明要写操作系统、关键库、CUDA 或容器摘要、是否使用网络调用。允许出域的步骤必须在网关留下模型名和时间,否则环境写“本地”却偷偷调用了外部接口,他人按说明会得到另一套结果。
第五步:论文投稿材料与平台记录交叉核对
图表题注、补充材料中的超参数、致谢或方法里的工具名称,应能指回运行编号和验证状态。对不上的数字,要么补跑并更新编号,要么从稿件删除。披露人工智能使用时,写工具、版本、用途和复核人,避免空泛的“使用了AI辅助”。这一步把可复现从平台功能接到学术责任,也是学校抽查时最容易当场验证的一条。
比较:一次生成当发现,还是可复现工作流
立项和组会最常见的混淆,是把“模型这次给出了合理假说”当成研究已经完成。下表用于区分两种做法。学校可以保留探索性对话,但验收科研能力、签署结论或对外宣传时,必须按右列检查,不能用左列演示代替。
| 维度 | 一次生成当发现 | 可复现工作流 |
|---|---|---|
| 输入是否固定 | 临时粘贴文本、未编号表格或“当前文件夹”,事后无法证明用了哪一版。 | 输入绑定数据卡版本、授权文献或仪器快照,编号写入运行日志。 |
| 模型与参数 | 只写“大模型”或界面默认值,提示词和温度被下次对话覆盖。 | 记录模型或工具名称、版本、参数、随机种子和环境,并可下载。 |
| 输出状态 | 生成即视为结论,候选、已核验、已拒绝混在同一段落。 | 默认候选;独立实验、公开基准或人工复核通过后才改状态。 |
| 证据与定位 | 综合表述无法回到表格坐标、段落或原始曲线。 | 引用、抽取字段和图表能回到原文、数据卡或实验记录。 |
| 对照方式 | 只展示最好一次生成,不报告失败,也不设基线。 | 同一划分和指标下与基线对比,保留失败案例和差异说明。 |
| 他人能否重做 | 换人换机后只能凭记忆重问,答案可以完全不同。 | 他人按复现说明重跑关键步骤,并解释差异是否落在约定范围。 |
| 数据权限 | 谁都能改共享盘,历史图与当前文件对不上。 | 生产数据仅授权成员可改;分析环境只读挂载并可重建。 |
| 论文与验收 | 用截图和流畅度验收,投稿数字无法交叉核对。 | 投稿材料指向运行编号;验收看状态、日志和复现包是否齐全。 |
选择时不要把探索性生成理解成违规,也不要把工作流理解成必须全自动、无人打断。合理形态往往是:聊天用于浏览和提问,正式假说、抽取表和拟合必须升格为带编号的运行。一所学校可以同时提供两类入口,但写入论文、结题和新闻的内容只能来自右列,且验证状态可见。建设整条科研平台时,应把本表与可验证任务路径一起使用,避免只建聊天框。
建设步骤:输入、角色、动作与输出
下列步骤按时间顺序排列。每一步都写出输入、责任角色、动作和输出,便于写入课题管理和平台验收。角色名称可按学校处室调整,但不能出现“只有厂商、没有学科主责”。
1. 冻结任务与复现范围
动作:写清哪些步骤必须可重跑、哪些结论必须经独立实验或人工复核、哪些材料禁止入模。输出:复现范围说明书、禁止自动发现清单和责任矩阵。没有评价方法的题目不得把“可复现”写成空口号。
2. 建立编号与数据、模型卡片
动作:为数据、代码、模型、实验记录分配编号;区分检索、计算、展示和禁止入模。输出:数据卡、模型或工具卡、授权台账。论文表格若进入后续计算,抽取规范见AI如何提取科研论文中的实验数据。
3. 固化工作流与导出规则
动作:把清洗、计算、抽查、归档连成可暂停流程;每次运行强制导出参数、种子和日志。输出:可运行工作流、日志模板和复现操作说明草稿。
4. 跑通基线、验证与状态机
动作:先复现基线,再跑候选方法,报告差异;需要新实验的结论不得只靠生成文本通过。输出:基线对比表、验证状态清单和失败案例。
5. 权限演练与投稿交叉核对
动作:未授权者不能改生产数据;复现人员按说明重跑关键步骤;稿件数字对运行编号。输出:权限测试记录、复现包、交叉核对表。缺核对表不得把平台截图当作论文补充材料。
如果某一步缺少输出物,不要扩大到下一课题或写入采购验收通过。尤其是没有数据卡就共享、没有基线就宣传提升、没有状态字段就把生成写入结论,都会在评审或抽查时暴露。
数据版本、模型版本与随机性如何写进卡片
卡片不是填表游戏,而是让“固定版本”变成可检查字段。数据版本回答:这份表从哪来、是否被清洗、和上一版差在哪里、谁有权改。模型或工具版本回答:调用的是权重、接口还是本地程序,许可证是否允许该用途。参数和随机种子回答:同样代码为何得到可解释的波动。环境回答:换一台机器还能否按说明重建。
数据卡建议固定的字段
- 编号、父版本、变更摘要,以及是否允许覆盖;默认不允许覆盖。
- 来源、采集仪器或人员、时间范围、已知缺口和批次。
- 许可与密级:开放、课题内、合作限制、伦理限制;禁止入模要单独标记。
- 字段含义、单位、缺失处理,以及是否经过人工清洗。
- 允许用途:检索、计算、展示、训练;跨组复制必须再授权。
- 责任人和保存位置,分析侧是否只读挂载该版本快照。
没有版本号的导出表,不得进入可引用分析。常见事故是从仪器电脑拷出“最终版.xlsx”,既无校验和,也无批次号,一周后实验室里出现三份同名文件。工作流应拒绝无编号输入,或在导入时强制生成数据卡草稿并冻结。
模型卡与工具卡建议固定的字段
- 名称、版本或提交哈希、量化方式、上下文或接口日期。
- 部署位置:校内、混合网关或受控外呼;是否可能被静默升级。
- 许可证、商用限制、是否允许微调,以及停服后的回退模型。
- 该任务评测集名称和上次对照日期,避免“最新”二字出现在方法部分。
通用对话模型可以出现在检索改写或材料草稿步骤,但关键数值必须以学科软件、仿真器或仪器返回为准,不能只信模型口述。工具目录应允许同一任务绑定多种后端,并在日志里分别记版本。平台建设中的工具登记顺序,见AI4S建设指南。
随机种子和环境说明写到什么粒度
种子要写清作用范围:数据划分、参数初始化、采样解码还是增强变换。只写一个整数却不写用在哪一步,复现者仍会对不上。环境至少锁定语言运行时、关键科学计算库、工作流定义版本和容器或镜像摘要。并行归约、非确定性内核和外部检索,应在复现说明中声明“允许的差异”和“必须一致的对象”。例如:划分索引必须一致,生成段落允许不同措辞但不得改变已核验数值。不要承诺所有生成文本比特级相同,那既不科学,也会逼着验收去核对无法稳定的字符串。
工作流日志、复现包与三类验证
工作流是把检索、清洗、计算、复核和归档串起来的可暂停过程,不是无人值守的自动科学家。日志的价值在于:失败可见、参数可下载、步骤可指向产物。复现包则是把一次或一组已接受运行打成他人可领取的说明加快照,而不是把整个实验室网盘打包。
一次正式运行的日志最低字段
- 运行编号、工作流定义版本、操作者和审批人。
- 输入数据版本、代码版本、模型或工具版本。
- 参数清单、随机种子及其作用步骤。
- 环境摘要、是否出域、外呼模型名与时间。
- 每步输入输出路径、耗时、退出码;超时不得被改写成成功。
- 产物校验和或等价指纹,以及当前验证状态。
涉及写入实验记录、修改共享分析表或外发材料的步骤,必须人工确认。低置信度抽取进入人工队列,禁止静默入库。抽取类任务还要把原文定位和单位换算链条留在产物里,避免复现时只剩一列“已经很干净”的数字。
复现操作说明怎么写才算能交给他人
说明应按“准备—挂载—重跑—对比—解释差异”书写,而不是广告式的功能列表。准备列出需要申请的空间和账号;挂载写只读快照编号;重跑写入口命令或工作流名称及禁止改动的参数;对比写与基线表的哪些列必须一致;解释差异写联系谁、日志在哪。若因保密不能提供原始数据,应提供合成样例或申请通道,并在说明中写清“完整复现需额外授权”,不能假装公开包已经自足。
独立实验、公开基准、人工复核如何分工
三类验证对应不同问题,必须在任务说明书里预先指定,不能等生成好看了再挑一种。公开或组内基准回答:在约定数据上,相对既有方法是提升、持平还是回退。独立实验或新批次回答:候选规律或配方在新样品、新条件下是否仍成立。人工复核回答:引用、抽取、单位和图表是否对得上原文或仪器。文献证据和表格抽取通常以人工复核为门禁;计算拟合通常先过基准再决定是否做新实验;新材料或新生物结论不能只靠基准集关闭问题。
状态机建议最少四态:候选、复核中、已核验、已拒绝。已拒绝必须保留,供失败分析和后续抽查。已核验才能进入论文终稿或对外共享基准。AI输出库与验证结果库分开,或至少分字段,避免一次导出把草稿和结论混成同一份 csv。更完整的平台分层仍以可验证任务为起点,见AI4S怎么建设。
交付物、验收与采购口径
核心交付物
- 数据卡和模型卡:含编号、许可、版本、用途和责任人。
- 工作流运行日志:含参数、随机种子、工具版本和可下载导出。
- 基线对比表:含划分、指标、差异方向和失败案例。
- 复现操作说明:含环境重建、只读挂载和差异解释路径。
验收应覆盖的条目
- 他人按说明能重复关键步骤:指定检查人现场或远程重跑,不由原操作者代点。
- 随机性被记录:种子、作用步骤和允许误差带写在日志与说明中。
- 结论有验证状态:抽查论文或报告中的关键句,能指回已核验运行。
- AI输出与验证结果分开存放:导出时能区分候选与已核验,未核验不得进入对外基准。
- 生产数据修改受限、分析环境可重建:越权写入失败并留痕;用说明重建后关键数值可对照。
- 投稿交叉核对:随机抽三张图或三张表,对上数据版本和运行编号。
验收必须使用双方确认的任务和数据,而不是厂商演示账号。未通过项列出缺陷、责任方和复测时间。采购参数按“对象—条件—期望—证据”书写,例如:在指定复现包上,第二操作者能完成关键步骤并输出与基线的差异表;学生账号不能修改其他课题组生产数据;系统不得提供“一键确认科学发现”。不要写唯一品牌、唯一模型,也不要写脱离数据集的发现数量或准确率。
商务和技术附件还应包含:工具等价替代后如何复测、试运行周期、学科培训对象、数据退出和日志移交。成本只要求供应商按学校给出的任务假设测算,不在本文给出价格。产品能力与审计留痕见AI4S科学智能科研创新平台。
相关建设页
可复现是AI4S验收的硬条件,需要与平台建设、实验抽取和产品能力一起阅读,避免只买生成界面。
- AI4S科学智能科研创新平台:文献辅助、数据协同、科研智能体工作流与合规审计。
- AI4S怎么建设:从可验证任务、数据规范到基准与实验验证的整条路径。
- AI如何提取科研论文中的实验数据:字段字典、原文定位、人工核验和误差分析。
- 高校AI智库 · 可复现专题:保障措施、交付物和验收要点的对照摘要。
- 安全与合规边界:数据分级、日志、生成内容治理和出域控制。
常见问题
AI4S结果可复现最少要固定什么?
最少固定数据版本、模型或工具版本、参数、运行环境和随机种子,并保存该次工作流的可下载日志。缺任何一项,他人就无法判断差异来自方法还是偶然。只保存聊天截图或最终图表,不算可复现。
能不能把一次生成结果当成科学发现?
不能。生成结果只是候选假说或待核验分析。必须用独立实验、公开或组内基准、或人工对照原文复核后,才能改状态为已核验。未核验内容不得写入论文结论、结题报告或对外新闻。
固定随机种子是否就能得到完全相同的数字?
不一定。种子能降低可解释的随机性,但并行计算、库版本、硬件和未记录的采样仍可能造成差异。应同时记录种子、库版本、硬件和是否允许误差带,并把差异写进复现说明,而不是承诺比特级一致。
公开基准和独立实验可以互相替代吗?
不能互相替代。公开或组内基准回答相对既有方法是提升、持平还是回退;独立实验或新批次回答候选结果在新条件下是否站得住。文献抽取类任务还须人工复核原文。一层通过不能自动宣布发现成立。
复现包至少应包含哪些文件?
至少包括数据卡、模型或工具卡、参数与随机种子、环境说明、工作流日志、基线对比表和复现操作说明。有抽取结果时还要带原文定位和核验状态。生产原始数据可按授权提供只读快照或申请通道,不能用无法重建的个人电脑路径代替。
论文投稿材料如何与平台记录交叉核对?
图表、表格和关键数值应能指回平台中的数据版本、运行编号和验证状态。披露AI使用范围时,写清工具名称、版本和人工复核人,而不是只写“使用了人工智能”。对不上运行记录的数字不得作为投稿终稿。
谁来判定可复现是否达标?
学科负责人判定方法、基线和结论是否成立;信息化确认环境可重建、日志可导出、权限可审计;科研处或研究生院抽查披露与诚信材料。厂商可以协助重跑,但不能代替学科签字。没有校内主责人不得验收通过。
分析环境可重建和生产数据谁能改,如何同时做到?
生产原始数据只允许授权成员按变更单修改,并保留不可覆盖的版本;分析环境用镜像、依赖锁定和只读挂载重建。复现人员拿到的是指定版本快照和工作流,而不是可随意改写的共享盘。未授权账号既不能改生产库,也不能把未发表数据拷出约定边界。
信息来源与更新原则
建设时应优先对照现行法律法规、科研诚信与伦理审查要求、人类遗传资源及生物安全相关规定、教育系统数据分类分级和生成式人工智能管理规定,以及学校章程、保密、知识产权、学术规范和采购制度。政策文本以发布机关最新原文为准,本文只提供建设方法,不替代合规或学术结论。
本文为通用建设方法,没有使用客户名称、项目人数、论文收录量、准确率承诺或效果数字。具体网络安全、数据合规、伦理审查和采购要求,应由学校主管部门结合最新法律政策及校内制度确认。任何性能或费用均需按双方确认的任务、数据集和测试条件复测。