小红书精读:RouteRec: Behavior-Guided Sparse Routing for Sequential Recommendation
MoE路由该拿什么当信号?答案在行为里
各位算法同学们,MoE做推荐的老问题不是专家不够多,而是没人说得清该按什么把session分给专家。RouteRec给了个朴素的答案:别只看hidden state,先用session自己的行为特征当路由信号,而且这个信号预测前就能从日志里拿到。
📄 RouteRec: Behavior-Guided Sparse Routing for Sequential Recommendation(CIKM ‘26)
🔧 路由信号换成四类行为线索:Tempo取时间戳节奏,Focus取item group变化,Memory统计会话内与会话间的重复与延续,Popularity用训练集频率。都是直接算出来的,不靠额外标注。
🧩 三级路由分工清楚:macro看整段历史,mid看session级,micro细到位置级。先用线索分数选专家组,组内再用当前backbone的hidden state细化挑专家。macro和mid的线索全位置共享,micro和组内打分才跟位置走。
⚙️ 只动FFN,不动注意力:backbone还是SASRec,把三处的feed-forward换成routed expert block,其余照旧,迁移成本不高。
📊 六个公开数据集、18个dataset-metric组合里,12个第一、3个第二,平均排名1.61,次好的baseline是4.11。
📈 九个baseline对比之外还做了matched control:换掉行为线索、只留hidden state路由,SASRec和DuoRec两个backbone上都掉点,说明涨的不是多出来的参数量。
✅ KuaiRec、LastFM、Retail Rocket三个数据集上三个指标全领先,专家使用率也随行为线索变化,路由分布和观测到的行为对得上。
🧠 我的判断:如果你在做session-aware序列推荐、已经用过MoE但说不清收益来自哪里,这篇的切入点可以直接抄——先定义可观测的路由信号,再谈专家容量。要盯的是平均排名和matched control,别只看单个数据集的最好值。两个坑:Focus线索依赖数据集自带的category/genre/artist,没有就补零,此时实际只有三类线索在工作;它替换的是FFN,如果backbone不是SASRec式结构,路由点得重新设计。

原文:AlphaXiv