Skip to content

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

Latest selected

1–11 of 53
TodayOct 1Thu
  1. Engadget · AI82

    Google 发布 Gemini 4 Argon 模型

    Google 发布 Gemini 4 Argon,主打深度推理与网络安全防御,在 CWE-bench 与 Grok 4.7、GPT-6 Astra 并列第一,幻觉率 15% 为领先模型中最低。Argon 输入 $2/M tokens、输出 $10/M tokens,输出上限 1M tokens;目前面向 Fairwind Program 成员,将逐步开放给开发者、企业与普通用户。

    Why it matters: Argon 在关键基准上对标 GPT-6 Astra 与 Opus,并以更低成本提供 1M 输出上限与 15% 幻觉率,适合关注推理与安全能力的读者参考。

  2. arXiv · Machine Learning Theory62

    扩散语言模型智能体的动作是否仍能解释任务:反向评分方法

    论文指出扩散大语言模型(dLLM)并行解码虽降低延迟,但智能体在具身任务中会陷入重试循环,原因在于掩码解码的自适应性使失败动作被上下文自信填充而未接触失败信号。作者将此建模为任务无关的上下文污染,并证明该污染因子在反条件概率中精确抵消;据此提出 Reflect Reverse 方法,通过掩码任务 token 并去噪来评估反向前向条件。实验在四个多轮具身基准上提升了任务成功率与进展率。

    Why it matters: 论文揭示了 dLLM 智能体重试循环的机制成因,并提供无需训练的反向前向评分修正方法。

  3. arXiv · Machine Learning Theory62

    Hermes:学习上下文推理解锁测试时计算扩展

    arXiv 论文提出 Hermes 框架,通过可配置 harness 让模型自主决定上下文分配与复用,并结合 Hermes-Learn 两阶段训练缩小不同规模模型的能力差距。

    Why it matters: 论文提出让模型自主决策上下文分配与复用的框架,为测试时计算扩展提供了可迁移的新方法。

  4. arXiv · Software Engineering60

    Adaptive-GEPA:让 Harness 适配异构请求

    论文提出 Adaptive-GEPA,在统一搜索预算下同时学习请求路由与专家程序库,路由与专家描述均为可读文本并由反馈编辑。在四任务族混合测试中,Qwen3-8B 运行进化出四个专家,路由与任务划分一致,家族均值得分从 52.6 提升至 70.6,高于 GEPA 全程序适配器(62.5)与 GRPO(54.0),名义预算为 18,000 次评分调用。

    Why it matters: 同一搜索预算下同时学习路由与专家程序,为异构请求场景提供可解释的分工优化路径。

  5. arXiv · Computation and Language64

    DAGent:面向深度研究代理的评估后扩展规划框架

    论文提出 DAGent,一种基于 DAG 的多代理框架,采用 Evaluate-then-Grow 增量规划,由编排器根据已完成节点的置信度与不确定性信号逐批扩展任务图。

    Why it matters: 通过增量规划与结构奖励信号缓解深度研究代理的脆弱性问题,为多智能体规划提供可复现的方法比较。

  6. arXiv · Computation and Language60

    诊断推理语言模型的 On-Policy Self-Distillation

    论文诊断了数学推理场景下的 On-Policy Self-Distillation(OPSD),覆盖 0.6B–8B 参数模型。实验与 token 级分析表明,教师信号受推理模式对齐与完整教师前缀影响,OPSD 仅在狭窄兼容 regime 中有效,否则出现长度膨胀、稳定退化或行为崩溃,且教师信号不稳定、无法预测下游性能。

    Why it matters: 论文通过受控实验和 token 级分析指出 OPSD 并非通用可靠的推理改进后训练方法。

  7. arXiv · Computation and Language62

    点向前向KL自蒸馏的裁剪为何会反转修正:On-policy Self-Distillation的失败动力学

    论文指出在数学推理的OPSD中,点向前向KL裁剪虽被用于稳定训练,却会导致学生模型产生更多持续到回复末尾的重复。理论分析证明裁剪目标可能无法将学生拉向教师,反而使裁剪与未裁剪词元概率偏离教师;实验显示在重复内部,裁剪学生更不愿离开重复而更倾向延续,未裁剪运行则更接近教师。

    Why it matters: 原文通过实验与理论分析揭示前向KL裁剪可能加剧重复而非稳定训练,读者可据此重新审视OPSD中裁剪策略的适用边界。

  8. arXiv · Computation and Language60

    Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment

    论文提出 CoT-Interpretability Alignment(CIA)指标,衡量大语言模型链式推理轨迹与内部推理策略的一致性。在两跳问答、提示干预和整数乘法三个任务上评估三个模型,对齐度仅 44.8-75.9%。通过后训练同时优化任务准确率和参数忠实度信号,可在保持或提升准确率的同时显著改善 CoT 参数忠实度,并提供泛化模式分析。代码与数据已公开。

    Why it matters: 提出了衡量链式推理与内部计算一致性的 CIA 指标,为审计大模型推理可信性提供了可复现框架。

  9. arXiv · Computation and Language60

    Recovering Off-Policy Supervision for Speculative Decoding

    论文提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被离策略 token 破坏的监督信号。在固定视觉语言和文本语料上,贪婪接受长度较 DFlash 最高提升 36.5%,单轮即超越最佳擦除策略,三轮后达到目标重生成响应的接受长度。代码已开源。

    Why it matters: 为固定语料上的推测解码训练提供了恢复完整监督的新方法,在接受长度和计算效率上对现有擦除基线形成优势。

  10. arXiv · Artificial Intelligence62

    When Context Changes: Understanding Update Failures in LLMs

    论文提出 Controlled In-Context Memory(CICM)基准,用于研究LLM在对话和Agent日志中跟踪与使用更新信息的能力。研究发现即使前沿推理模型也常出现 stale binding,即答案沿用旧值;开源模型中探针仍可恢复新值,说明是信息选择失败。

    Why it matters: 提出CICM基准并定位注意力漂移机制,为理解模型为何使用过时信息提供了可迁移的分析框架。

  11. arXiv · Artificial Intelligence62

    OpenJev-RLCD:面向推理模型的校准决策强化学习实现

    作者提出 OpenJev-RLCD,一种对推理模型进行校准决策的强化学习实现:模型先生成理由,再用严格真确评分规则对答案分布打分。实验基于 Qwen3-1.7B,在两个推理任务上 RLCD 在准确率和选择性预测上匹配或优于 SFT、RFT/STaR 与 GRPO;GSM8K 答案验证中单次查询可覆盖约 80% 项目且误差不超过 5%。代码与结果已开源。

    Why it matters: 论文给出 RLCD 的两阶段实现与 GSM8K 上的可复现结果,读者可据此判断校准式强化学习是否值得替代现有 RLVR 方法。