小红书精读:Routing Between Generative and Collaborative User Profiles: A Serving-Time Gate for Controllable Novelty
LLM画像别全量上,路由12.5%就够
各位算法同学们,LLM用户画像不是全量部署就越好。这篇在真实流媒体数据上只把12.5%的用户路由到LLM画像模型,就在5%的NDCG损失预算内把Novelty@10抬了6.5%。
📄 Routing Between Generative and Collaborative User Profiles: A Serving-Time Gate for Controllable Novelty
🔧 把“要不要用生成式画像”从离线表示问题改写成serving-time的逐用户路由:默认走协同序列模型,只有对该用户预期划算时才切到profile模型。
🧩 gate只用serving时能拿到的特征——历史长度及其对数、已消费物品的均值与中位流行度、小众内容占比、协同和语义表示的范数;训练标签是ΔNovelty>0且ΔNDCG≥0,用GBDT做二分类。
⚙️ 阈值τ可以扫,得到的是一条novelty–relevance前沿,而不是一个写死的混合策略;打分用五折out-of-fold,避免用户自己的结果泄漏进gate训练。
📊 5% NDCG-loss预算下,Novelty@10提升6.5%,只路由12.5%的用户。
📈 在相同relevance成本下,比niche启发式、短历史启发式和随机路由的novelty增益都更大。
✅ 换成非生成的Centroid语义画像也有类似收益,说明好处主要来自选择性路由,而不是LLM生成本身,这点挺反直觉。
📉 实验是1万真实流媒体用户,覆盖电影、剧集、体育;所有结果都是相对“一直走协同模型”的相对变化。
总结感想:适合已经在做画像或多路召回、想在生产里加novelty指标的团队。两个坑要留意,Novelty用的是self-information,和业务口径的“新鲜感”未必对齐;gate依赖流行度类特征,热度分布漂移时阈值得重扫。要盯的是NDCG-loss预算怎么定、路由比例是否稳定、线上novelty有没有真的动。
原文:AlphaXiv