小红书精读:SPAR: Enhancing Industrial-Scale Generative POI Recommendation via Real-World Spatial Perception
POI推荐总迷路?把城市空间塞进大模型
各位算法同学们,有没有遇到过这种情况:模型推荐的下一个POI和你兴趣高度匹配,但一看距离,直线两公里,中间隔条江,绕行要四十分钟。这篇工作就是来治这个病的——把真实城市空间感知注入生成式POI推荐,而不是让模型只靠行为共现去猜地理。
📄 SPAR: Enhancing Industrial-Scale Generative POI Recommendation via Real-World Spatial Perception
🔧 SI-SID:把经纬度坐标用正弦编码成地理空间嵌入,和POI的文本语义embedding融合后再做RQ-Kmeans量化。这样得到的SID既保留“它是谁”,又带上“它在哪”,相邻POI的编码也更容易相邻。
🧩 MG-CPT:在LLM上做多粒度持续预训练,喂了25个地图、道路、导航类数据集,从基础属性到成对关系再到城市级导航层层递进,让散落的行为序列变成有距离、有方向、有可达性的城市空间认知。
⚙️ TV-SFT:把CPT学到的空间知识固化成参数空间里的任务向量,在做行为SFT时把这个向量锚定住,防止灾难性遗忘。相当于一边学用户兴趣,一边兜住城市地理常识。
📊 实验方面,论文在2个公开数据集和4个工业级POI数据集上做了完整验证。📈 消融实验分别证明SI-SID、MG-CPT、TV-SFT三个模块各自有独立贡献,组合起来效果最好。✅ 团队还放出4个工业级POI推荐数据集、每城市25个地理空间训练集和18任务空间认知benchmark,复现门槛大幅降低。
个人判断:这套思路对做地图、本地生活、LBS推荐的同学是重要的参考。落地时要重点盯“真实可达性”指标,比如推荐POI与用户实时位置的路网距离、预计通行时间,而不是只看离线Recall/NDCG。坑也明显:MG-CPT需要丰富的路网与导航数据,一般团队不太容易凑齐;TV-SFT的任务向量调参也需要额外实验。建议先用作者放出的数据集复现,再考虑场景适配。

原文:AlphaXiv