跳到正文
原文
arXiv · Neural and Evolutionary Computing· Liuxian Ma, Jiale Dai, Jiaqi Li, Lu Mi·· 3 小时前AI 评分42

T-Router:通过参数高效强化学习实现推理的丘脑路由机制

T-Router: Learning Thalamic Routing for Reasoning with Parameter-Efficient Reinforcement Learning

AI 导读

T-Router 在 8.95B 参数主干上仅分配 41.73M 参数(占主干 0.466%),经 GSM8K RL 训练后 MathAvg 达 83.64,超越全参数 GRPO 的 73.79 和 LoRA 的 77.28,AIME 均值从 48.33 提升至 60.56。其通过可寻址块变化库与深度循环控制器实现计算复用,以正确性奖励训练接口并保持主干参数与层序不变。

来源:arXiv · Neural and Evolutionary Computing · arxiv.org