预实验工程(Pre-Experiment Engineering)——先用证据判断方向,再投入正式研究

预实验工程(Pre-Experiment Engineering)——先用证据判断方向,再投入正式研究 预实验工程Pre-Experiment Engineering生成看似合理的候选想法正在变得容易然而获得可靠证据依然困难。预实验工程关心的是怎样在正式投入之前让候选方向先接受一次检查与测试。过去一个研究团队通常要经过长期的文献阅读、领域学习和讨论才能逐渐形成少数可能的研究方向。如今随着大模型能力的快速发展接入搜索、程序和其他工具的大模型智能体已经能够协助整理资料、比较不同观点、提出候选问题还可以在获得相应权限后分析数据、运行模拟或调用实验设备。这种能力扩大了科研探索的范围却没有自动解决选题风险问题。模型很容易生成逻辑顺畅、表面新颖但可能已经被别人做过、无法检查、依赖错误资料或者在实际研究中并不成立的方案。此外实验时间、经费、设备、样品和研究人员的注意力仍然有限。在一部分适合使用智能体的研究场景中范式正在从“怎样产生候选想法”转向“怎样可靠地筛选候选想法”。我们把一种面向这个问题的大模型应用方法范式称为“预实验工程Pre-Experiment Engineering”。它位于“提出研究想法”和“投入完整研究”之间研究者与智能体先比较多个候选方向找出决定性的疑问再通过文献核查、已有数据分析、计算模拟、复现或小规模现实实验获得新的判断依据。目的是决定哪些方向值得继续哪些需要调整、暂存或停止以及哪些异常结果可能形成新的研究问题。预实验工程不是一套需要单独开发的软件框架也不依赖某个特定品牌的模型。Codex、Claude Code 或其他能够使用工具的智能体都可以承担其中适合自动化的部分。本文讨论的是一种组织人与智能体共同开展科研前期工作的思路。为什么需要预实验工程科研并不是随便找一个现象做实验。研究者一般要先了解别人已经知道什么哪些结论仍有争议现有方法有什么缺陷哪些问题真正值得投入。这个过程高度依赖长期积累的领域知识也是科研中最费时间、最需要判断力的环节之一。大模型改变了其中一部分工作的成本。它可以快速整理大量论文寻找相互矛盾的说法提出不同解释并生成许多候选课题。接入工具的智能体还可以进一步查找数据、运行程序和复现公开结果。过去需要多人分工完成的部分前期工作现在可以由人与智能体协作完成。问题在于生成一句合理的解释远比确认这句解释是否可靠容易。2026 年的一篇 arXiv 观点预印本把这种变化概括为人工智能显著降低了生成“看起来像科学成果”的内容的成本却没有以同样幅度降低验证这些内容的成本。[1]自然语言处理领域的一项研究提供了一个现实例子。在评审者不知道想法由人还是由模型提出的情况下人工智能生成的研究想法被评为更具新颖性但可行性评分略低系统还表现出不善于评价自己的想法、不同想法之间相似度偏高等问题。[14] 这项结果不能代表所有学科却说明“能大量提出想法”和“能选出值得实践的想法”是两种不同的能力。如果面对几十个候选方向只让另一个模型根据文字打分得到的仍然是模型意见。更可靠的做法是先找出每个方向最关键的疑问再选择成本和风险合适的预实验使这些想法尽早接触数据、现实条件和反面证据。这样模型生成的“可能性”才能逐渐变成研究者可以审查的“证据”。预实验工程的方法预实验工程目标是在有限资源下尽快减少那些会影响立项决定的不确定性。它不是把每个想法都缩小做一遍也不是追求预实验数量而是不断追问哪一项检查最可能改变我们下一步的选择整个方法可以归纳为四个连续阶段。不同学科可以调整其中的具体做法获得新证据后也可以回到前一步但所有方法性工作都围绕这四个阶段展开。证据不足或出现新问题方向成熟界定研究决定与边界形成候选方向并设计预实验执行、记录并审查证据继续、调整、暂存或停止进入正式研究界定研究决定并形成候选方向预实验工程应先明确团队需要作出什么决定。例如团队是在多个机制解释中选择一个重点还是要从几种技术路线中决定哪个值得进入正式项目这个决定会影响后面需要阅读什么、测量什么以及做到什么程度才足够。研究者要提前说明现实边界包括可用时间、预算、数据、设备和人员哪些任务可以交给智能体哪些必须由领域人员执行以及哪些伦理、安全、隐私和法律要求不能突破。这些限制不是附带信息而是判断一个方向是否值得做的重要组成部分。一个理论上有趣却无法合法、安全或可靠实施的方向不应因为模型评分很高就被优先推进。智能体协助整理与当前决定有关的知识。它需要说明哪些结论已经得到多次支持哪些研究互相冲突哪些关键条件没有被比较候选方向是否已有先例以及哪些来源足以改变团队的看法。研究者仍需亲自核查决定性的论文、原始方法和反面证据模型给出引用并不代表它正确理解了引用。在此基础上人与智能体共同形成一组原理上有所不同的候选方向。候选不能只是同一种方法换几个参数或标题而应尽量覆盖不同解释和不同路线同时为少量高风险但潜在价值较大的想法保留位置。数量不必很多关键在于每个方向都能回答几个基本问题它想解释或解决什么为什么可能重要主要依据是什么最可能错在哪里以及它与其他方向有什么实质区别。把研究方向转化为预实验一个方向或者机制只有变成可以观察和判断的具体预期才可能转化为预实验。“这个方案可能有效”并不足够。团队需要说明如果解释是对的应该看到什么如果出现什么结果就应降低对它的信心如果结果模糊究竟是方向本身有问题还是当前方法没有能力判断。接下来要识别的是“关键不确定性”。一个方向可能同时存在很多未知但并非每个未知都值得立即检查。真正应该优先处理的是那些一旦得到不同答案就会明显改变方向排序、资源投入或安全判断的问题。围绕这些问题团队选择最小而有用的预实验它应尽量节省成本和时间但不能小到无论出现什么结果都不会改变决定。预实验可以采用不同形式。下面的类型不是固定的等级也不要求依次全部完成。高质量的数据复查可能比设计不良的小实验更可信数学问题中的严格推演也不能由现实样品测试替代。预实验形式主要作用不能被误解为什么关键文献与新颖性核查确认引用是否真实、结论是否被正确理解、方向是否已有先例它不能证明被讨论的现象一定存在已有数据分析与结果复现检查已有结果是否稳定寻找明显反例判断方法能否重现它不等于这次研究获得了新的现实观察计算、模拟与理论推演快速检查逻辑、可能范围、参数敏感性和机制是否自洽模拟中的成功不能自动代表现实成功小规模现实实验或现场检查让方向接受真实条件约束暴露样品、设备、环境和流程问题小规模结果不能直接替代充分的正式研究换方法或独立复查使用不同人员、设备、数据或分析方法检查关键现象一次复查仍可能只适用于有限条件每项预实验在执行前都要写清楚它服务于哪个决定使用什么资料、样品或输入观察哪些主要结果怎样进行公平比较以及什么情况下继续、调整或停止。还应当明确它不能证明什么。这样可以避免看到结果以后再改变标准把任何结果都解释成对原想法有利。预实验的规模应与风险相称。低风险的代码复现可以快速迭代涉及人体、动物、危险化学品、隐私或生物安全时即使规模很小也必须经过相应审批和专业监督。“只是预实验”不能成为降低安全与伦理要求的理由。执行预实验并建立可审查的证据记录预实验虽然规模较小也要尽量公平。涉及样品比较时不同方向应使用相近条件保留必要的对照避免只依赖单一样品也不能对偏爱的方向使用更有利的指标。数据和计算研究同样要防止只选择有利数据、反复更换指标或事后补充解释使任何结果都能被说成“符合预期”。执行方式不需要统一。Codex、Claude Code 或其他智能体在接入相应工具并获得权限后可以搜索资料、读取文件、分析数据、编写和运行程序、制作图表并持续整理记录现实实验可以由研究人员或获准的自动设备执行再把原始记录交给智能体协助分析。没有接入某种工具或设备的智能体不能仅靠对话完成对应任务一段提示词也不能自动保证科学质量。研究者最终看到的不应只是智能体生成的结论。证据记录至少要保留资料来源、实际步骤、原始数据、分析方法、使用条件、失败过程和异常结果。对于计算工作应保留足够信息使别人知道程序在什么条件下运行对于现实实验应保存原始测量和必要的环境信息。完整报告方法和结果、让别人能够复查也是可重复科研长期强调的基本原则。[15]不同类型的材料必须分开标注。新采集的仪器或现场观测属于这次研究直接获得的现实数据从公开数据重新计算出的结果来自已有资料模拟输出只在相应模型和假设下成立模型生成的解释则是一段等待核查的文字。它们都可以帮助决策但不能全部被称为第一手现实证据。得到结果后还要专门寻找其他解释。团队可以让智能体扮演批评者检查引用误读、数据泄漏、测量偏差、遗漏变量或无法复现的步骤也可以使用另一个模型或独立会话复查论述。不过模型之间相互同意不能算作独立科学验证它们不能代替领域专家、重新分析或独立实验。为了避免把模糊结果强行归入成功或失败预实验结果至少应区分四种情况当前证据对方向提供支持当前证据构成挑战证据不足以判断预实验本身失效。后两种情况不应被算作支持或反对而应帮助团队改进方法或暂时保留问题。从预实验结果形成研究决定每轮预实验结束后团队都应作出清楚的资源决定。证据和现实条件较为有利时可以继续增加投入原来的说法不成立但结果指向了更好的问题时可以调整方向当前工具、样品或资料不足时可以暂存并写清重新启动需要什么条件已有反面证据、成本或风险足够明确时可以停止当前版本影响较大或风险较高的结果则应进入更严格、独立和充分规模的验证。这些决定针对的是当前证据下怎样分配资源并不是对真理作永久判决。一次小规模负面结果不能证明一个想法永远错误一次正面结果也不能证明机制已经成立。为了避免过早淘汰真正困难的创新团队应允许高价值方向在证据不足时进入“暂存”而不是简单地按一次结果清除。预实验还承担发现新问题的任务。如果结果没有支持原来的想法却暴露出稳定的异常、无法解释的冲突或新的条件关系这些内容可以成为下一轮候选方向。旧方向的失败和新方向的产生应分别记录不能把意外发现包装成原假设已经成功。这一阶段的主要产物是一份供研究者决策的预实验报告而不是“AI 推荐课题排行榜”。报告应说明候选方向及其依据最关键的不确定性实际执行的预实验获得的支持、挑战、无结论或失效结果原始资料所在位置仍未解决的风险以及继续、调整、暂存、停止或升级验证的理由。方向进入正式研究时这份报告也应说明下一步最关键的问题以及哪些前期结果仍可能只是偶然。预实验工程本身也需要接受长期评价。不能只看生成了多少课题、完成了多少预实验也不能用正面结果比例衡量成功。更值得观察的是团队是否更早发现了关键风险是否减少了对薄弱方向的长期投入是否保留了真正不同的候选路线决定能否被其他研究者根据记录复查负面结果是否得到保存以及进入正式研究时关键问题是否比过去更清楚。还应回看被停止或暂存的方向如果后来证据显示某些方向被过早淘汰就要调整当时使用的早期指标和判断规则。它与现有科研方法的关系预实验工程并不是从零开始发明一套科学方法。它吸收了文献综述、试点研究、自动实验、主动选择下一次实验以及 AI 科研助手等已有做法但把它们集中到一个明确的任务上在正式投入大量资源之前比较哪个研究方向更值得继续。方法它主要回答什么与预实验工程的关系文献综述别人已经知道什么哪些地方仍有争议是预实验工程的重要起点但通常不直接产生新的现实观察也不一定比较多个方向的投入价值试点或可行性研究一个已经选定的研究能否顺利开展通常服务于既定主研究预实验工程还要先比较哪个方向值得进入主研究。在临床干预研究中NIH/NCCIH 也强调试点研究主要回答“能不能做”不能被当成小规模的效果证明。[12]自动化或自驱实验室在一个已经确定的目标中下一次实验做什么擅长在给定方向内选择和执行实验预实验工程还可以决定是否更换或停止整个方向。[11]AI Scientist 类系统怎样从想法继续执行实验、分析结果甚至形成论文部分系统展示了从想法到实验或论文的较长流程预实验工程主要服务于正式研究之前的方向选择。[5]正式研究一个重要现象或解释能否在严格条件下成立是预实验筛选后的主要投入阶段不能被前期结果替代机器提出并检验科学假设并不是新出现的想法。2004 年的 Robot Scientist 已能产生假设、设计和执行实验并根据结果排除不一致的解释2009 年的 Adam 系统进一步展示了自动提出和实验检验生物学假设的可能性。[3] [4]大模型出现以后The AI Scientist、Co-Scientist 和 Robin 等系统把文献搜索、想法生成、实验、数据分析或论文写作连接成了更长的流程。[5] [6] [7] 另一些工作更接近“先用证据筛想法”MOOSE-Chem3 根据已测试假设的反馈调整其他假设的优先级MIND 使用计算实验检查材料假设Popper 则让智能体主动设计用于挑战假设的分析。[8] [9] [10]图Co-Scientist架构a、概述协同科学家Co‑Scientist结构化科学推理引擎的不同组成部分——多智能体系统以及其与科研人员的交互范式。给定自然语言描述的研究目标协同科学家可以生成全新的研究假设。该系统采用基于Gemini的专用智能体包括生成智能体、反思智能体、排序智能体、演化智能体、邻近度智能体用于评估相关性以及元评审智能体提供高层次分析在竞赛框架内持续生成、研讨并迭代优化研究假设。竞赛产生的反馈支持迭代改进形成自优化循环产出新颖且高质量的假设用以解决复杂科学问题。协同科学家调用网络搜索以及专用人工智能模型等工具提升生成研究假设的事实依据与质量。科研人员可通过指定用户界面以自然语言和协同科学家对话明确研究目标、加入约束条件、给出反馈、引导探索方向并提出新的研究思路。b、底层多智能体架构监督智能体解析用户以自然语言表述的研究目标并在异步任务队列中为各专用工作智能体动态分配资源。“协同科学家专用智能体”板块中的红色方框代表各个独立智能体每一个都具备独有的逻辑与职能。蓝色方框代表科研人员的介入输入与反馈。深灰色箭头代表协同科学家内部的信息流转红色箭头代表各专用智能体之间的信息反馈回路。c、协同科学家针对三项复杂程度各不相同的生物医学问题开展端到端验证协同科学家针对急性髓系白血病提出老药新用候选药物上图为肝纤维化挖掘全新表观遗传靶点中图独立复现了一项当时尚未发表的同步研究成果该成果是与抗菌素耐药性相关的新型细菌基因转移机制下图。协同科学家生成的全部假设后续均通过独立的体外实验室实验完成验证。因此预实验工程不主张发明了自动实验或假设验证。它所强调的是一个较少被单独讨论的位置在智能体已经能够生成许多候选想法之后用新的、可复查的证据帮助人比较多个研究方向再决定哪些方向值得进入正式研究。价值、风险与适用范围预实验工程最直接的价值是让当前不适合继续投入的版本更早暴露。正式研究中的一个错误前提可能消耗很长时间如果一项规模较小、目的清楚的预实验能提前发现问题即使结果是否定或无结论的它仍然节省了后续资源。完整保存这些结果也能避免后来者反复走入同一个死胡同并可能从“为什么没有按预期发生”中发现新的研究问题。它也有助于把“听起来不错”变成“开始接受事实约束”。研究者进入陌生领域时智能体可以先组织候选方向、关键来源和争议使人的阅读更快聚焦到真正影响决定的材料。不过这只能加快前期定位不能代替系统性阅读和长期的领域知识积累。风险同样明显。模型可能遗漏论文、虚构引用或者把已有方法重新包装成新想法大量标题看似不同的方向也可能共享同一个未经检验的前提。对大规模论文记录的一项研究发现AI 工具的使用虽然与更高的个人产出和影响力相关却也伴随研究主题范围收缩。[13] 因此预实验工程不能只追求模型评分最高或最容易检查的方案还要保留原理不同、风险较高但潜在价值较大的路线。小规模检查本身也可能出错。样品过少、时间过短、环境没有控制好可能产生偶然的正面或负面结果反复尝试不同数据和指标也容易偶然找到一个漂亮组合。模拟只能说明“在当前模型和假设成立时会发生什么”涉及现实经验判断的方向最终仍需现实测量或其他独立证据。预实验工程较适合候选路线较多、早期信号可以较快观察、检查成本能够逐步增加而且每轮结果确实会改变下一步选择的问题。例如算法思路的早期比较、公开数据中的机制线索、材料候选的初筛以及某个现象的多种可能解释。如果结果必须等待多年才会出现缺少可靠的早期指标小规模条件与真实环境差别极大或者试错本身具有不可逆危险那么这种方法的作用会受到明显限制。在数学研究中计算可以帮助寻找反例和形成直觉却不能代替严格证明在人文和社会价值问题中数据检查也不能取代伦理、历史和社会判断。预实验工程不是为了让机器替科学家选择真理而是为了在候选想法大量增加时建立一个更诚实的中间环节让想法在获得长期资源之前先接受一次与投入规模相称的检查让继续和停止都有清楚理由也让失败和异常有机会成为下一项研究的起点。人工智能可以绘制更多地图预实验工程要做的是在正式远征之前为不同道路安排一次合适的侦察。参考文献与相关工作Ma, J. W. (2026).Toward an Engineering of Science: Rebalancing Generation and Verification in the Age of AI. arXiv:2605.10425. https://arxiv.org/abs/2605.10425Machmouchi, W., Gupta, S., Zhang, R., Fabijan, A. (2020).Patterns of Trustworthy Experimentation: Pre-Experiment Stage. Microsoft Research. https://www.microsoft.com/en-us/research/articles/patterns-of-trustworthy-experimentation-pre-experiment-stage/King, R. D., Whelan, K. E., Jones, F. M., et al. (2004). Functional genomic hypothesis generation and experimentation by a robot scientist.Nature, 427, 247–252. https://doi.org/10.1038/nature02236King, R. D., Rowland, J., Oliver, S. G., et al. (2009). The automation of science.Science, 324(5923), 85–89. https://doi.org/10.1126/science.1165620Lu, C., Lu, C., Lange, R. T., et al. (2026). Towards end-to-end automation of AI research.Nature, 651, 914–919. https://doi.org/10.1038/s41586-026-10265-5The AI Scientist 的初始预印本于 2024 年公开arXiv:2408.06292Gottweis, J., Weng, W.-H., Daryin, A., et al. (2026). Accelerating scientific discovery with Co-Scientist.Nature, 655, 487–496. https://doi.org/10.1038/s41586-026-10644-yGhareeb, A. E., Chang, B., Mitchener, L., Yiu, A., et al. (2026). A multi-agent system for automating scientific discovery.Nature, 655, 497–505. https://doi.org/10.1038/s41586-026-10652-yLiu, W., Yang, Z., Wang, J., et al. (2025).MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback. arXiv:2505.17873. https://arxiv.org/abs/2505.17873Ahn, G., Lee, D., Doo, H., Na, J., Cho, H., Kim, S. (2026).MIND: AI Co-Scientist for Material Research. arXiv:2604.13699. https://arxiv.org/abs/2604.13699Huang, K., Jin, Y., Li, R., Li, M. Y., Candès, E., Leskovec, J. (2025). Automated Hypothesis Validation with Agentic Sequential Falsifications. InProceedings of the 42nd International Conference on Machine Learning, PMLR 267, 25372–25437. https://proceedings.mlr.press/v267/huang25n.htmlCanty, R. B., Bennett, J. A., Brown, K. A., et al. (2025). Science acceleration and accessibility with self-driving labs.Nature Communications, 16, Article 3856. https://doi.org/10.1038/s41467-025-59231-1National Center for Complementary and Integrative Health. (n.d.).Pilot Studies: Common Uses and Misuses. National Institutes of Health. Accessed August 19, 2026. https://www.nccih.nih.gov/grants/pilot-studies-common-uses-and-misusesHao, Q., Xu, F., Li, Y., Evans, J. (2026). Artificial intelligence tools expand scientists’ impact but contract science’s focus.Nature, 649, 1237–1243. https://doi.org/10.1038/s41586-025-09922-ySi, C., Yang, D., Hashimoto, T. (2025). Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100 NLP Researchers. InInternational Conference on Learning Representations (ICLR 2025). ICLR 官方页面Munafò, M. R., Nosek, B. A., Bishop, D. V. M., et al. (2017). A manifesto for reproducible science.Nature Human Behaviour, 1, Article 0021. https://doi.org/10.1038/s41562-016-0021