Skip to content

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

Latest selected

21–40 of 82
Oct 5Mon
  1. arXiv · Machine Learning Theory69

    Trained Agentic Context Management 研究用自调用工具训练 Qwen3.6-35B-A3B

    论文提出训练式智能体上下文管理方法,在最简工具框架下微调 Qwen3.6-35B-A3B,工具包括以任意提示词调用自身以及读取输入上下文指定区间的 token。在 OOLONG-synth 基准上,当文档长度超过 40K token 时,模型仅用 8,000 token 上下文就达到 GPT-5.4 使用 1M token 上下文的同等强度。论文共 17 页、6 幅图、4 张表,并给出代码链接。

    Why it matters: 论文用极简自调用工具训练小模型,在长文档基准上以 8,000 token 上下文对标 GPT-5.4 的 1M token 表现。

Oct 2Fri
  1. arXiv · Artificial Intelligence78

    冲突监督移动承诺而非能力:12.29σ 排列效应在约定无关评分下恰好为零

    论文证明在相同问题上用两种不兼容但都正确的约定训练模型时,学习率排程是排序效应的平均算子:排列仅作为块周期,学习率仅控制终点对某一时刻的权重。恒定学习率使内部分配跨度达 0.2221、对比度底边 11.63,而余弦调度下十个臂只能区分两种状态。

    Why it matters: 同一语料十种排列在恒定学习率下产生 12.29σ 的排序效应,但约定无关评分下为零,揭示训练排布影响模型承诺而非能力。

  2. arXiv · Artificial Intelligence62

    测量微任务资格缺口:现成小语言模型何时足以支撑 Agent Harness

    论文构建了 4 个微任务基准,以低成本非 LLM 基线为阈值 τ,用 CI 感知规则检验 Qwen3 0.6/1.7/4/8B(FP16、贪心、无微调),结果 16 个配置均未通过资格缺口。

    Why it matters: 用可复现的 CI 置信区间规则衡量 SLM 微任务资格,帮助从业者在 harness 中更稳妥地分配 SLM 与基线。

  3. arXiv · Artificial Intelligence62

    理由传递到底在传递什么:角色分工 QA 中的消息干预研究

    该研究固定证据和候选答案,只改变 reasoner 与 verifier 之间传递的理由,发现忠实理由几乎不提升答案准确率,而被篡改的理由会显著改变支持性判断。

    Why it matters: 研究揭示理由信息在验证环节的实际作用,帮助读者判断是否应继续把理由传递作为提升准确率的主要手段。

  4. arXiv · Statistics Machine Learning60

    Wasserstein 梯度流与正向扩散不足以实现多模态采样

    该论文论证基于 Wasserstein 梯度流(WGF)和正向扩散过程(FODP)的采样算法虽常被宣称指数快速收敛,但在多模态分布上会继承亚稳态与慢混合现象。通过 JKO 格式和 Otto 微积分,作者证明 WGF 与过阻尼正向扩散具有相同的密度演化,并利用谱分析与平均首次通过时间(MFPT)分析指出,模态分离会导致指数级混合时间。

    Why it matters: 研究指出 Wasserstein 梯度流与正向扩散在多模态采样中存在结构性慢混合问题,提示局部梯度机制难以高效跨模态传输。

  5. 量子位82

    Google Gemini 4 Argon Suddenly Released, Outperforming GPT and Opus with RSI Scores

    Google launched Gemini 4 Argon on the first day of the holiday, dominating or tying for first place in evaluations such as DeepSWE v1.1, CWE-bench v1, and Vals Index. Its RSI score surpasses that of GPT-6 Astra. Argon offers a significant cost advantage, costing approximately 20% less per million input tokens and 10 dollars per output token, with a maximum output capacity of one million tokens. The first batch is available through the Fairwind program to approved cybersecurity defense teams.

    Why it matters: By offering a lower price and a higher output capacity, Google provides users with a new, cost-effective option that competes with Opus and GPT in complex workloads.

Oct 1Thu
  1. Engadget · AI82

    Google 发布 Gemini 4 Argon 模型

    Google 发布 Gemini 4 Argon,主打深度推理与网络安全防御,在 CWE-bench 与 Grok 4.7、GPT-6 Astra 并列第一,幻觉率 15% 为领先模型中最低。Argon 输入 $2/M tokens、输出 $10/M tokens,输出上限 1M tokens;目前面向 Fairwind Program 成员,将逐步开放给开发者、企业与普通用户。

    Why it matters: Argon 在关键基准上对标 GPT-6 Astra 与 Opus,并以更低成本提供 1M 输出上限与 15% 幻觉率,适合关注推理与安全能力的读者参考。

  2. arXiv · Machine Learning Theory62

    扩散语言模型智能体的动作是否仍能解释任务:反向评分方法

    论文指出扩散大语言模型(dLLM)并行解码虽降低延迟,但智能体在具身任务中会陷入重试循环,原因在于掩码解码的自适应性使失败动作被上下文自信填充而未接触失败信号。作者将此建模为任务无关的上下文污染,并证明该污染因子在反条件概率中精确抵消;据此提出 Reflect Reverse 方法,通过掩码任务 token 并去噪来评估反向前向条件。实验在四个多轮具身基准上提升了任务成功率与进展率。

    Why it matters: 论文揭示了 dLLM 智能体重试循环的机制成因,并提供无需训练的反向前向评分修正方法。

  3. arXiv · Machine Learning Theory62

    Hermes:学习上下文推理解锁测试时计算扩展

    arXiv 论文提出 Hermes 框架,通过可配置 harness 让模型自主决定上下文分配与复用,并结合 Hermes-Learn 两阶段训练缩小不同规模模型的能力差距。

    Why it matters: 论文提出让模型自主决策上下文分配与复用的框架,为测试时计算扩展提供了可迁移的新方法。

  4. arXiv · Software Engineering60

    Adaptive-GEPA:让 Harness 适配异构请求

    论文提出 Adaptive-GEPA,在统一搜索预算下同时学习请求路由与专家程序库,路由与专家描述均为可读文本并由反馈编辑。在四任务族混合测试中,Qwen3-8B 运行进化出四个专家,路由与任务划分一致,家族均值得分从 52.6 提升至 70.6,高于 GEPA 全程序适配器(62.5)与 GRPO(54.0),名义预算为 18,000 次评分调用。

    Why it matters: 同一搜索预算下同时学习路由与专家程序,为异构请求场景提供可解释的分工优化路径。

  5. arXiv · Computation and Language64

    DAGent:面向深度研究代理的评估后扩展规划框架

    论文提出 DAGent,一种基于 DAG 的多代理框架,采用 Evaluate-then-Grow 增量规划,由编排器根据已完成节点的置信度与不确定性信号逐批扩展任务图。

    Why it matters: 通过增量规划与结构奖励信号缓解深度研究代理的脆弱性问题,为多智能体规划提供可复现的方法比较。

  6. arXiv · Computation and Language60

    诊断推理语言模型的 On-Policy Self-Distillation

    论文诊断了数学推理场景下的 On-Policy Self-Distillation(OPSD),覆盖 0.6B–8B 参数模型。实验与 token 级分析表明,教师信号受推理模式对齐与完整教师前缀影响,OPSD 仅在狭窄兼容 regime 中有效,否则出现长度膨胀、稳定退化或行为崩溃,且教师信号不稳定、无法预测下游性能。

    Why it matters: 论文通过受控实验和 token 级分析指出 OPSD 并非通用可靠的推理改进后训练方法。

  7. arXiv · Computation and Language62

    点向前向KL自蒸馏的裁剪为何会反转修正:On-policy Self-Distillation的失败动力学

    论文指出在数学推理的OPSD中,点向前向KL裁剪虽被用于稳定训练,却会导致学生模型产生更多持续到回复末尾的重复。理论分析证明裁剪目标可能无法将学生拉向教师,反而使裁剪与未裁剪词元概率偏离教师;实验显示在重复内部,裁剪学生更不愿离开重复而更倾向延续,未裁剪运行则更接近教师。

    Why it matters: 原文通过实验与理论分析揭示前向KL裁剪可能加剧重复而非稳定训练,读者可据此重新审视OPSD中裁剪策略的适用边界。

  8. arXiv · Computation and Language60

    Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment

    论文提出 CoT-Interpretability Alignment(CIA)指标,衡量大语言模型链式推理轨迹与内部推理策略的一致性。在两跳问答、提示干预和整数乘法三个任务上评估三个模型,对齐度仅 44.8-75.9%。通过后训练同时优化任务准确率和参数忠实度信号,可在保持或提升准确率的同时显著改善 CoT 参数忠实度,并提供泛化模式分析。代码与数据已公开。

    Why it matters: 提出了衡量链式推理与内部计算一致性的 CIA 指标,为审计大模型推理可信性提供了可复现框架。

  9. arXiv · Computation and Language60

    Recovering Off-Policy Supervision for Speculative Decoding

    论文提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被离策略 token 破坏的监督信号。在固定视觉语言和文本语料上,贪婪接受长度较 DFlash 最高提升 36.5%,单轮即超越最佳擦除策略,三轮后达到目标重生成响应的接受长度。代码已开源。

    Why it matters: 为固定语料上的推测解码训练提供了恢复完整监督的新方法,在接受长度和计算效率上对现有擦除基线形成优势。

  10. arXiv · Artificial Intelligence62

    When Context Changes: Understanding Update Failures in LLMs

    论文提出 Controlled In-Context Memory(CICM)基准,用于研究LLM在对话和Agent日志中跟踪与使用更新信息的能力。研究发现即使前沿推理模型也常出现 stale binding,即答案沿用旧值;开源模型中探针仍可恢复新值,说明是信息选择失败。

    Why it matters: 提出CICM基准并定位注意力漂移机制,为理解模型为何使用过时信息提供了可迁移的分析框架。

  11. arXiv · Artificial Intelligence62

    OpenJev-RLCD:面向推理模型的校准决策强化学习实现

    作者提出 OpenJev-RLCD,一种对推理模型进行校准决策的强化学习实现:模型先生成理由,再用严格真确评分规则对答案分布打分。实验基于 Qwen3-1.7B,在两个推理任务上 RLCD 在准确率和选择性预测上匹配或优于 SFT、RFT/STaR 与 GRPO;GSM8K 答案验证中单次查询可覆盖约 80% 项目且误差不超过 5%。代码与结果已开源。

    Why it matters: 论文给出 RLCD 的两阶段实现与 GSM8K 上的可复现结果,读者可据此判断校准式强化学习是否值得替代现有 RLVR 方法。

  12. Digital Trends · AI82

    Gemini 4 Argon 发布,Google 称其为迄今最雄心勃勃的 AI 模型

    Google 发布 Gemini 4 Argon,称其支持百万 token 输出、复杂编码与网络安全任务,并在知识工作、两项编码基准及科学数学测试中领先 GPT-6 Astra 与 Claude Fable 5.1。Argon 限时定价为输入 $2、输出 $10,目前仅向美国政府机构与少量测试者开放,后续将面向付费 API 用户与 Google AI Ultra 订阅者推出。

    Why it matters: Google 强调 Argon 在长上下文、网络安全与多模态任务上的能力,并给出限时定价,读者可据此评估其相对竞品的定位与可用成本。