SheepNav
精选11天前0 投票

GxP-Agent:用流程DAG拓扑实现可靠的临床试验编程

临床试验编程——将研究方案转化为符合CDISC标准的分析就绪数据集——一直是监管申报中的瓶颈。尽管大语言模型在代码生成方面表现出色,但面对这一高度规范化的任务,即便是最先进的模型也频频“翻车”:在11次单次尝试中,五个前沿模型无一能生成有效的受试者水平分析数据集。

针对这一困境,研究人员提出了 GxP-Agent,一个多智能体系统,将监管流程顺序编码为有向无环图(DAG),将庞大的数据集生成任务分解为15个由工作智能体执行的领域特定节点,并配备pharmaverse技能上下文、验证门控和条件重试机制。

实验结果:近乎完美的表现

在基于FDA试点提交CDISCPilot01构建的CDISC-Bench基准上(254名受试者,49个真实ADSL变量),GxP-Agent配合Claude Sonnet 4.6实现了100%的结构匹配(49/49变量,254条正确记录),且三次独立运行结果一致。相比之下,最佳检索增强基线仅达到59.2%的结构匹配,而所有单智能体和扁平多智能体方法均为0%。

更令人惊喜的是,DAG拓扑还让较弱模型也能发挥潜力:GPT-4.1在相同DAG下达到59.2%的平均结构匹配,而在其他架构下其得分均为0%。

泛化能力与意义

该方法的有效性不仅限于ADSL。在不良事件数据集ADAE(9节点分支DAG,55个变量,1,191条记录)上,GxP-Agent首次尝试即实现100%的结构匹配,证明了其泛化能力。

这项研究的核心启示在于:将领域过程知识编码为图拓扑,而非单纯依赖LLM推理,是实现可靠、符合GxP(良好实践规范)的临床试验编程的关键。这为AI在高度监管的医疗健康领域的应用开辟了新的思路,也提醒我们,在专业场景中,结构化的流程设计或许比追求模型参数规模更重要。

该论文为预印本,详细内容可参考arXiv:2608.16890。

延伸阅读

  1. Sayscroll:随声而动的AI提词器,让演讲更自然流畅
  2. 告别你的弃坑项目:RIP MY BUILD 为它举行最后一次“发布”
  3. ChordWeaver:用乐理解锁音乐创作与学习的新维度
查看原文