Paper Pilot:人机协同的专家系统,为科学论文生成提供证据可追溯性
随着大语言模型(LLM)智能体在科研工作流中的深度嵌入,文献分析、论文草拟与评审等环节正经历深刻变革。然而,现有系统在推进自主发现与稿件生成的同时,也带来了一个治理难题:当想法、方法、结果和主张在AI辅助流程中传播时,往往缺乏强制的人工审批或工件级别的可追溯性。针对这一问题,一篇发表于arXiv的论文提出了Paper Pilot——一个面向应用科学领域、强调人机协同与证据可追溯的专家系统。
核心机制:八道审批关卡与证据锁定
Paper Pilot 将CARE(协作式智能体推理工程)方法论适配到稿件开发流程中,通过稿件所有者审批关卡、明确的不通过标准、主张分类、审计日志、顾问式LLM评审以及证据锁定修订控制等机制,构建了从想法到主张的完整治理框架。该系统定义了八个审批关卡,覆盖从创意到结论的整个流水线,并严格区分基于文献的主张与基于工件的主张,要求报告的数字和解释必须可追溯到已批准的证据。其系统提示词已公开,可部署于ChatGPT、Gemini、Claude等商业LLM或机构内部环境。
实证验证:引用造假率降至零
研究者对系统的引用扎根层进行了首次实证评估,采用受控的机械评分基准(使用两个商业LLM、真实arXiv论文,无LLM评委)。结果显示,在覆盖压力下,未经门控的草拟者最多捏造了25%的引用,且从未标记证据缺口;而采用Paper Pilot证据锁定规则的同一模型则零捏造引用,并将预设的缺口显式标记为占位符。初步结果还表明,在结果扎根、修订和对抗鲁棒性方面,该系统同样表现出积极效果。
定位与展望:从自主生成到受控决策
Paper Pilot将LLM辅助写作定位为受控的人机AI决策支持过程,而非完全自主的作者流水线。这一理念回应了学术界对AI科研透明度和问责制的迫切需求。尽管目前仍处于初步验证阶段,但其零捏造引用的成果为AI辅助科研的合规化提供了重要参考。未来,研究者计划开展更全面的评估,以进一步验证系统在多样化场景下的有效性。
对于科研人员、学术机构及AI开发者而言,Paper Pilot的发布不仅是一个技术方案的展示,更是对AI时代科研诚信体系构建的积极探索。它提醒我们,在拥抱AI带来的效率提升时,必须同步建立严格的监督与追溯机制,确保科学发现的可靠性与可信度。