SheepNav
新上线今天0 投票

用LLM扩展闭环特征通道配置:更大规模下的优化与架构规律

一项新研究将大语言模型(LLM)驱动的闭环通道配置搜索从稀疏采样扩展到密集采样,验证了优化行为的可迁移性,并发现了更深层的架构规律。

研究背景

先前的研究表明,通过让LLM生成可执行代码并接收准确率反馈,可以直接优化神经网络的宽度(通道数)。然而,这些结果仅基于少量有效评估,未能确认在更密集的采样下优化行为是否持续,以及是否会出现新的架构规律。

扩展实验设置

为了验证这一点,研究者将每个微调周期的候选网络数量提升至250个,共完成8个完整周期,生成了2000个候选网络。经过任务和元数据过滤后,获得了462个有效的CIFAR-100评估结果

关键发现

1. 优化信号可迁移

  • 平均准确率:每个周期的平均准确率呈现正向线性趋势,斜率为9.87e-4(p=0.043),表明优化信号在密集采样下依然有效。
  • 前沿性能:最佳准确率从0.3144提升至0.3676,top-5和top-10平均准确率也呈正向趋势。

2. 参数效率显著提升

最佳模型在达到0.3676准确率时仅需1180万参数,而早期一个高性能模型(0.3144准确率)却需要1.665亿参数。这证明LLM引导的搜索不仅提升了准确率,还大幅提高了参数效率。

3. 架构规律浮现

更大规模的样本揭示了先前难以察觉的架构规律:

  • 非2的幂次通道宽度:在有效候选中,41.8% 的网络采用了非2的幂次的通道数,打破了传统设计惯例。
  • 结构化通道分配模式:最强模型在早期采用中等宽度,而在中间或后期块中扩展通道数,形成了特定的分配模式。

意义与展望

这项研究证实了LLM驱动的闭环通道搜索在更大规模下的有效性,并揭示了数据驱动的架构设计规律。未来,该方法有望与神经架构搜索(NAS)结合,为自动化模型设计提供新思路。研究者计划进一步探索更复杂的搜索空间,并验证该方法在其他数据集上的泛化能力。

延伸阅读

  1. PhantomFill:当表单要求答案,语言模型便自行编造
  2. 多模态CoLRAG-TF:三重过滤检索破解复杂PDF文档难题
  3. 循环Transformer中的自适应深度:诊断学习型停止门与轨迹读出机制
查看原文