小红书精读:Cross-Country Code-Mixing for Generative Recommendation

less than 1 minute read

跨国推荐ID不互通,代码混搭破局 🌍

各位算法同学们,跨国家推荐里各市场的用户ID和商品ID完全不重叠,传统跨域方法赖以为生的共享锚点直接消失。阿里国际这篇工作换了个思路:自然语言里有多语言code-switching语料,推荐为什么不能自己造一份?

📄 Cross-Country Code-Mixing for Generative Recommendation

🔧 共享语义码本:先编码多模态内容,再跨国家联合训一个行为驱动的i2i对齐模型,共享负样本池让“长得像且行为也像”的商品互相靠近,最后过RQ-VAE出token序列。这个码本一物两用,既是GR的tokenizer,也是跨国替换的公共语义空间。

🧩 双重约束的token级混搭:替换发生在语义token上而不是各国家的item ID上,候选必须同时过静态内容约束(token序列的汉明距离)和动态属性约束(价格、受众、热度按国家分位数分桶对齐后的余弦相似度)。只靠标题图片相似就替换,在两个市场里可能是完全不同的角色,噪声很难控。

⚙️ 上下文感知重加权:item级过滤管不了上下文,一个和Apple设备序列不搭的安卓平板,内容属性都对得上但意图是错的。于是让GR模型自己算 P(y’ x) 除以 P(y x)+P(y’ x) 当权重,带stop-gradient,只用来给噪声样本降权,不回流梯度。

📊 两个真实多国家数据集上,数据稀疏国家提升明显,数据充足国家没有掉点,说明不是简单的此消彼长

📈 线上A/B:广告收入 +1.77%

✅ 订单 +2.64%,来自大型电商平台的真实大盘

总结:如果你在做多市场或多域的生成式推荐,尤其小市场冷启动、想从大盘借信号,这篇的“数据级迁移”比纯参数共享更直接,也容易接进现有GR pipeline。要盯的是稀疏国家的收益和大市场有没有负迁移;两个坑先划出来,码本低频更新,价格热度这类快变量必须自己补一路side-info分桶,不然会拖后腿;替换率k和采样子率p直接决定混入多少噪声,建议先在单个小市场小步调。

原文:AlphaXiv

Updated: