小红书精读:SoftModel: A Neural Model That Grows Its Own Topology – Governed Structural Growth for Continual In-Service Learning

less than 1 minute read

结构也能训练?模型自己长拓扑!

各位算法同学们,如果我说模型的结构应该像权重一样终身可训练,甚至能在服役期间自己长出神经元和注意力头,你会不会觉得有点反常识?这篇工作干脆把“总可塑性”当公理:训练完不等于冻结,拓扑结构也是可学习自由度。

📄 SoftModel: A Neural Model That Grows Its Own Topology – Governed Structural Growth for Continual In-Service Learning

🔧 核心创新之一是所有结构操作都是“精确保持”的。加宽、加深、新增输入特征、加注意力头,应用瞬间模型输入输出完全不变,之后由held-out真实性门控决定要不要采纳,参数更新和结构变化用同一套标准审判。 🧩 第二个创新是“治理式增长”:成长变成低风险投机,模型想怎么长都行,但提交服务版本时必须在最近的真实数据切片上严格超过当前版本。稳定不再靠冻结参数,而是靠生命周期审计。 ⚙️ 第三个是局部求解环:长出带收缩认证的有向循环,让计算在局部迭代,还有自处理单元在新结构内部按局部目标精炼,不扰动全局学习契约。

📊 在标准持续学习基准上,受治理的增长保住了沿长任务序列继续学习的能力,不会越学越僵。 📈 预注册的EWC基线对比:四个终身任务里三个在适应性和保留性上同时达到或超过EWC最佳网格,一个miss如实报告。 ✅ 还测出一个反直觉结论:新容量的边际价值在采用前根本观测不到,所以增长治理只能事后裁决,事前投机无门。

💡 这个工作最打动我的是把稳定性从参数属性变成审计属性,而且失败也按预注册协议全量公开。对做持续学习、动态架构的同学,这个治理框架可以仔细拆解;但落地前要盯住两个坑:LLM操作整个生命周期的可靠性,以及门控在概念漂移下是否真的严格。别指望开箱即用。

原文:AlphaXiv

Updated: