小红书精读:Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

less than 1 minute read

💥 堆数据不如提密度?用户表征有定律

💥 各位算法同学们,用户行为序列从30天拉到270天,原始数据建模的AUC只涨了1.6个点,而tokenized表示能涨2.5个点,差距不是调参能补的。这篇工作将这个规律总结成“行为稠密定律”,并给出自适应token分配方法,做大规模用户表征的团队值得看看。

📄 Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

🔧 技术创新点: 🔧 提出 User Behavioral Densing Law:在千亿级支付宝数据上验证原始数据扩展撞墙,用理论加实验拟合出最小充分token容量与输入token数的对数尺度近似线性关系,斜率随tokenizer和数据源变化。 🔧 揭示 raw data scaling wall:当把编码器从0.2B扩到0.4B参数时,预训练loss下降但下游AUC几乎不变,说明数据信息密度才是瓶颈。 🔧 设计 ALGN:根据量化残差和表达不确定性给每个样本分配不同长度token,高信息熵行为多给码,低信息熵行为少给码,逼近最小充分容量。

📊 实验效果: 📊 序列长度从30天扩到270天时,tokenized模型AUC从72.28升到74.78,raw模型只从72.36升到73.96,差距从0.08扩大到0.82。 📈 用户量从1000万扩到1亿时,tokenized模型AUC从73.39升到74.56,raw模型从73.47升到73.92,tokenization的提升约是raw的2.6倍。 ✅ 编码器参数从0.2B翻倍到0.4B时,raw数据下下游准确率几乎不变。

💬 总结感想:这个定律对已遇到原始数据扩展收益递减的团队很实用,配置token容量可以直接按数据量推算。但缩放斜率需要用自己的数据源和tokenizer先标定,跨域套用会有偏差;ALGN的可变长度机制会增加工程开销,但换的是容量效率。

图 1

原文:AlphaXiv

Updated: