精选10天前0 投票
FinSkillBench:评估AI代理在投资管理中的专业技能
投资管理是一个高风险领域,代理型AI系统不仅要生成合理的文本,还必须检索时点数据、组装正确的计算输入、调用专业方法,并生成可审计的结构化输出。为此,研究者推出了FinSkillBench——一个专门评估语言模型代理在投资管理任务中有效运用金融领域技能的基准测试套件。
基准构成与评估方法
FinSkillBench覆盖三个领域:投资组合构建、风险管理和基本面分析,包含12个子任务和2,603个任务片段。每个片段提供时点输入、隐藏的真实结果和特定任务的目标。
研究团队对比了三种条件:无技能、精选技能包(包含程序化文档和可执行组件)以及自我生成技能(代理在片段内编写并复用自身程序)。
关键发现:精选技能显著提升表现
在9个模型的大规模评估中,精选技能持续改善性能,平均得分从0.366提升至0.528,尤其在投资组合构建和风险管理领域效果最为显著。相比之下,自我生成技能尽管计算成本更高,却几乎未带来额外收益。
独立验证与结论
独立测试使用Hermes Agent框架,涵盖8个模型和5,280个片段,在三个领域均复现了相同趋势,但技能效果的大小因子任务和工具而异。
这些结果表明,在投资管理代理中,获取可靠的程序化技能可能与模型选择同等重要,而天真的自我生成技能往往无效。研究者已公开基准、评估工具、精选技能包和完整轨迹,以支持进一步研究。



