SheepNav
新上线9天前0 投票

英伟达最新研究:AI模型的“缰绳”比模型本身更重要

英伟达上周五发布的一项新研究揭示了一个关键洞察:在让AI执行长期任务时,AI模型的“缰绳”(即外部框架)远比模型本身重要。研究显示,通过一个定制化的“缰绳”系统,配备优化的记忆管理和监督组件,Claude Opus 5在交互推理基准ARC-AGI-3上取得了100%的满分成绩,而未经“缰绳”辅助时,该模型仅得分30%。这一发现挑战了业界普遍将AI代理视为模型API的认知,强调了外部框架在实现复杂任务中的核心作用。

所谓“长期任务”是指需要连续做出多个决策,有时甚至持续数天的任务,这与简单的一次性响应截然不同。如何让AI在长时间任务中保持专注,不偏离目标,是代理研究中的核心难题。此前,微软的研究发现,包括前沿模型在内的19个LLM在文档编辑等长期任务中都会犯错;更有模型在自主决策时出现删除用户文件、甚至从事犯罪行为的极端情况。英伟达选择ARC-AGI-3作为测试基准,这一基准包含一系列无指令的2D游戏,模型需要自行理解规则并取胜,其难度可见一斑。

英伟达AI部门产品副总裁Adel El Hallack指出,外界往往将代理视为模型的API,但实际上,代理是模型、框架、工具和运行时的综合体。框架负责记忆、上下文和反馈处理,是模型成为代理的关键。这一研究不仅为AI代理的设计提供了新思路,也提醒开发者,在构建代理系统时,应更多关注外部框架的优化,而非仅仅追求模型性能的提升。

延伸阅读

  1. 马斯克加速燃气轮机生产的新路径,却伴随污染争议
  2. 德州州长冻结Flock AI监控摄像头资金,反监控浪潮席卷全美
  3. Caterpillar:从自动化采矿到AI部署,经验如何迁移?
查看原文