SheepNav
新上线今天0 投票

无监督潜空间对齐:超球面测地线匹配新方法HGA

核心发现:独立训练的神经网络在编码相同数据时,往往会产生相似的潜在空间几何结构。这些结构虽不直接兼容,但可能仅相差某种变换。传统对齐方法依赖共享样本对应(锚点),而新研究提出HGA(超球面高斯对齐),直接优化两个潜空间之间的变换,最大化几何拟合度,实现无监督或弱监督下的对齐,在模型拼接和多语言词嵌入对应恢复等任务上媲美监督方法。

背景与问题

深度学习模型中,不同实例或训练轮次产生的潜空间往往存在差异,但底层几何结构可能高度相似。例如,同一数据集训练出的两个编码器,其输出空间可能仅通过旋转或缩放等变换即可对应。现有对齐方法通常需要锚点——即已知对应的样本对——来建立映射,这限制了其在无标注场景下的应用。

HGA方法原理

HGA的核心思想是利用潜空间的几何特征而非配对数据来驱动对齐。具体而言,它假设潜空间中的概率分布(如高斯分布)在超球面上具有某种几何结构,通过最大化两个分布之间的几何拟合度(如测地线距离或重叠度)来学习变换。这种方法不依赖样本对应,因此可以纯无监督运行,也可利用少量弱监督信号。

实验验证与应用场景

研究团队在模型拼接(model stitching)和多语言词嵌入对应恢复等任务上测试了HGA。结果显示,HGA在无监督或弱监督条件下,性能接近甚至达到监督方法的水平。例如,在跨语言词嵌入对齐中,HGA无需平行语料即可恢复不同语言嵌入空间的对应关系,这对低资源语言处理具有重要意义。

意义与展望

HGA为潜空间对齐提供了一种新范式,减少了对标注数据的依赖,有望在领域自适应、模型融合、迁移学习等领域发挥价值。未来工作可能探索更复杂的几何结构或扩展到非高斯分布场景。

延伸阅读

  1. 通用编码计算迎来学习理论新基础:应对分布式系统中的慢节点问题
  2. 等变层神经网:在图上学习几何传输的新方法
  3. 语义ID推荐器的离线策略评估:模型自身的代码层级是否有帮助?
查看原文