SheepNav
新上线2天前0 投票

Anthropic研究员展示自我改进AI:自动化系统提升对齐基准

Anthropic的研究员陈跃涵(Chen Yueh-Han)在最新论文中展示了一项突破性进展:AI系统能够自主改进自身的对齐训练,在10个对齐基准上均提升性能,且不损害整体表现。这一成果被视为迈向递归自我改进的重要一步,但也引发了对人类研究员未来角色的讨论。

自动化对齐研究员(AAR)的运作机制

该研究题为《自动化研究员能够可靠缓解对齐失败》,由Anthropic的Fellows项目研究员陈跃涵领导。系统模拟了传统研究流程:每个自动化系统搜索现有文献,提出方法,并用该方法训练模型30分钟,通过多次迭代逐步提升基准分数。有效方法被保留,无效的被丢弃,使得系统能够快速且大规模运作。

性能与成本优势

论文指出,最佳的AAR方法在平均6小时内就能超越经验丰富的人类研究员提出的方案,且人类引导的研究方向并未带来更强性能。成本方面,AAR每小时约需4美元的API推理费用,而人类研究员每小时成本高达150美元。

局限性与未来展望

尽管成果显著,论文也承认了局限性:自动化系统依赖于基准的准确性,且基准的建立与维护仍需大量工作。此外,文献库的维护与扩展也是挑战。尽管如此,论文认为,自动化对齐后训练在短期内可能变得实用,这为递归自我改进铺平了道路。

行业影响与反思

这一进展引发了对AI研究未来的深思。如果模型能自我改进对齐训练,那么更广泛的训练实践也可能被优化,人类研究员可能面临角色转变。然而,正如论文所强调,目前仍需人类来设定对齐目标与维护基准,完全自主的AI研究仍有一段距离。

延伸阅读

  1. 马斯克加速燃气轮机生产的新路径,却伴随污染争议
  2. 德州州长冻结Flock AI监控摄像头资金,反监控浪潮席卷全美
  3. Caterpillar:从自动化采矿到AI部署,经验如何迁移?
查看原文