语义ID推荐器的离线策略评估:模型自身的代码层级是否有帮助?
生成式推荐系统正越来越多地采用语义ID(SIDs)作为物品表示,每个物品被编码为残差量化器产生的短序列层次化离散码,并通过自回归方式解码。在投入稀缺的A/B测试资源之前,团队通常需要离线判断哪些解码器或重排序变体值得测试,这正是离线策略评估(OPE)的用武之地。一个自然的问题是:模型自身的SID树能否作为OPE的动作抽象?近期一篇arXiv论文对此进行了探讨,给出了三部分答案。
核心发现
(i)物品级OPE在真实日志上几乎不可行:真实推荐系统常采用近argmax的日志策略,导致物品级别的有效样本量通常很小,直接进行OPE误差巨大。然而,将物品粗化到代码前缀簇(code-prefix clusters)后,可恢复可估计的支持度并显著降低误差。
(ii)获益主要来自粗化,而非层级本身:但SID树使得粗化在生成式系统中变得可行——每个簇的质量可由解码器精确且廉价地返回,而扁平聚类则需要枚举物品/叶子质量,而纯代码解码器无法直接提供这些信息。
(iii)分辨率深度是操作旋钮:在支持度稀缺时,应选择更粗的粒度。论文还推导了一个条件偏差界限,将粗化偏差与量化器的最坏情况重建残差以及目标-日志策略散度联系起来。
意义与启示
这项研究为生成式推荐系统的离线评估提供了实用指导。它表明,利用模型自身的SID层级结构进行粗化,可以在不牺牲太多准确性的情况下,有效缓解OPE的数据稀疏问题。对于实践者而言,这意味着在A/B测试之前,可以更可靠地筛选候选模型变体,从而节省宝贵的流量资源。
然而,论文也指出,粗化的收益并非源于层级本身,而是源于其提供的便捷性。因此,在其他系统中,若能以低成本实现类似的粗化,也可能获得类似的好处。此外,分辨率深度的选择需要权衡偏差与方差,论文给出的偏差界限为这种权衡提供了理论依据。
总之,这项研究为生成式推荐系统的离线评估开辟了新的思路,并提供了可操作的建议。未来的工作可以进一步探索如何动态调整粗化粒度,以及如何将这种方法扩展到更复杂的推荐场景。