Skip to content

千问 Qwen

阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

Latest selected

1–3 of 9
TodayOct 1Thu
  1. arXiv · Computation and Language66

    终端智能体能信任自己的验证吗?诊断与改进自验证

    论文提出诊断框架,系统评估终端智能体在 TerminalBench2.1 上的自验证行为,发现验证几乎总会触发,但错误检出率仅 61.43%、修复率仅 49.36%,主要瓶颈在检测与修复而非启动验证。

    Why it matters: 诊断了终端智能体自验证的漏检与修复率,并给出蒸馏方法提升修复效果。

  2. arXiv · Artificial Intelligence62

    When Context Changes: Understanding Update Failures in LLMs

    论文提出 Controlled In-Context Memory(CICM)基准,用于研究LLM在对话和Agent日志中跟踪与使用更新信息的能力。研究发现即使前沿推理模型也常出现 stale binding,即答案沿用旧值;开源模型中探针仍可恢复新值,说明是信息选择失败。

    Why it matters: 提出CICM基准并定位注意力漂移机制,为理解模型为何使用过时信息提供了可迁移的分析框架。

  3. arXiv · Artificial Intelligence62

    OpenJev-RLCD:面向推理模型的校准决策强化学习实现

    作者提出 OpenJev-RLCD,一种对推理模型进行校准决策的强化学习实现:模型先生成理由,再用严格真确评分规则对答案分布打分。实验基于 Qwen3-1.7B,在两个推理任务上 RLCD 在准确率和选择性预测上匹配或优于 SFT、RFT/STaR 与 GRPO;GSM8K 答案验证中单次查询可覆盖约 80% 项目且误差不超过 5%。代码与结果已开源。

    Why it matters: 论文给出 RLCD 的两阶段实现与 GSM8K 上的可复现结果,读者可据此判断校准式强化学习是否值得替代现有 RLVR 方法。