小红书精读:Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling
ID表砍98%,好友推荐线上+16%
🔥 各位算法同学们,一张200GB的ID embedding表,怎么砍到2GB还不掉点?这篇论文给出了一个工业级答案。它把multi-hash和时序采样在1.94亿用户、280亿边的社交图上落地,线上好友添加数+16%。
📄 Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling
🔧 多哈希ID嵌入:每个用户ID映射进共享小表,ID表从>200GB降到2GB,压缩98%+,排序质量几乎不损。 🧩 时序邻居采样:邻接表按时间戳排序存CSR,采样时二分查找定位合法历史前缀,单点复杂度从O(deg+k)降到O(log deg+k),训练吞吐提升约2.5倍。 ⚙️ 端到端训练管线:CPU采样与GPU训练解耦,配合离线embedding刷新,单台8卡机器就能处理225GB图。
📊 离线消融:在1.94亿节点、280亿边上逐项验证multi-hash和时序采样各自贡献。 📈 在线A/B:好友添加数比强基线+16%,独立添加用户数+11.5%。 ✅ ID表从>200GB降到2GB,压缩超过98%,排序质量与全量ID表持平。
💬 个人看法:这工作胜在工程决策,模型本身还是GATv2,网上能抄的细节很多。落地时注意两点:multi-hash要接受哈希碰撞的代价,时序采样要求边时间戳干净,否则剪错历史会带偏邻居分布。
原文:AlphaXiv