跳到正文
热点事件持续更新

LLM 路由机制演进:T-Router 与 FlexRouter

2 篇报道2 个报道来源2 小时前更新

先了解这件事

AI 综述

T-Router 与 FlexRouter 均于 2026-10-01 发布。T-Router 在 8.95B 主干上仅分配 41.73M 参数(占主干 0.466%),经 GSM8K RL 训练后 MathAvg 达 83.64,超越全参数 GRPO 的 73.79 和 LoRA 的 77.28,AIME 均值从 48.33 提升至 60.56;其通过可寻址块变化库与深度循环控制器实现计算复用,以正确性奖励训练接口并保持主干参数与层序不变。FlexRouter 将 LLM 路由建模为覆盖导向的子集选择问题,利用 DPP 捕捉模型能力与冗余性,最大化至少一个模型给出正确答案的概率;训练目标基于对失败集的边缘化,推理时采用基于边际对数行列式增益的贪心策略,无需预设计算预算即可自适应确定子集大小,在 RouterEval 基准上域内域外均比强基线实现更高覆盖、更低冗余,同时保持灵活的推理成本。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月1日 12:00 · 1 篇报道
    T-Router:通过参数高效强化学习实现推理的丘脑路由机制
    arXiv · Neural and Evolutionary Computing:T-Router:通过参数高效强化学习实现推理的丘脑路由机制
  2. 10月1日 12:00 · 1 篇报道
    FlexRouter: Learning Complementary Model Sets for Flexible L
    arXiv · Machine Learning Theory:FlexRouter:学习互补模型集实现灵活的 LLM 路由

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Machine Learning Theory
    FlexRouter:学习互补模型集实现灵活的 LLM 路由

    FlexRouter 将 LLM 路由建模为覆盖导向的子集选择问题,利用 DPP 捕捉模型能力与冗余性,最大化至少一个模型给出正确答案的概率。训练目标基于对失败集的边缘化,推理时采用基于边际对数行列式增益的贪心策略,无需预设计算预算即可自适应确定子集大小。在 RouterEval 基准上,FlexRouter 在域内和域外任务上均比强基线实现更高覆盖、更低冗余,同时保持灵活的推理成本。

  2. arXiv · Neural and Evolutionary Computing
    T-Router:通过参数高效强化学习实现推理的丘脑路由机制

    T-Router 在 8.95B 参数主干上仅分配 41.73M 参数(占主干 0.466%),经 GSM8K RL 训练后 MathAvg 达 83.64,超越全参数 GRPO 的 73.79 和 LoRA 的 77.28,AIME 均值从 48.33 提升至 60.56。其通过可寻址块变化库与深度循环控制器实现计算复用,以正确性奖励训练接口并保持主干参数与层序不变。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。