AI 日报 · 2026 年 10 月 2 日 · 星期五
HOTAI
Ataraxos击败Stratego世界冠军,棋类最后堡垒失守
Ataraxos在Stratego中以85%有效胜率击败四届世界冠军Niemeijer,训练成本不到DeepMind DeepNash的1/500。系统通过正则化强制多样化玩法,并利用信念网络预测对手隐藏棋子,在16张H100 GPU上训练一周。
模型发布/更新
AI击败Stratego世界冠军,棋类最后人类堡垒之一失守
Ataraxos在Stratego中以85%有效胜率击败四届世界冠军Niemeijer,成本不到DeepMind DeepNash的1/500。系统通过正则化强制多样化玩法,并利用信念网络预测对手隐藏棋子,在16张H100 GPU上训练一周即达成该结果。
产品发布/更新
OpenAI称阻止模型推理窃取活动,但该手段在Azure仍有效
OpenAI披露7月起针对其模型推理的提取攻击,攻击者通过跨会话复用加密推理包让廉价模型充当解密 oracle,完整还原强模型的思维链。研究者 Joachim Schaeffer 团队在 Azure 上对 GPT-6 Astra 及 Anthropic 模型仍可成功复现,而 OpenAI 与 Anthropic 自身 API 已阻断;另一简单方法通过虚拟记事本工具亦可读取推理。
DeepSeek 开源华为 Ascend 芯片编程工具 TileLang
DeepSeek 在微信宣布开源六款面向华为 Ascend 芯片的软件模块,包含 TileLang 编程语言及计算与通信库,作为 Nvidia CUDA 的替代方案。DeepSeek 表示该工具已用于 AGI 工作,并计划与华为在超级节点等更多项目上合作。
Olmo-core 3 发布:面向大规模 MoE 的开放可扩展训练框架
AllenAI 发布 Olmo-core 3,重设计 MoE 训练系统以支持万亿参数规模。在专家池从 8 扩至 128、每 token 仅选 4 个专家的配置下,总参数从 4.6B 增至 47B,训练吞吐下降不到 5%;在 8 块 NVIDIA B300 上,47B MoE 吞吐约 2.7 倍提升。
如何在 Harness 中构建模型路由器
LangChain 在 Open SWE 中构建了模型路由器,根据任务类型和复杂度将请求路由到不同层级模型,中位成本降低 64%,合并 PR 率无显著变化。路由器基于线程首条用户消息进行分类,使用 Jev 作为分类模型,并将路由决策与任务层级标准深度耦合。
GitHub Copilot 新增桌面应用计算机使用功能
GitHub Copilot 在 CLI 和桌面应用中开放 computer use 公测,可读取桌面应用内容并模拟点击、输入、滚动等操作,适用于无 API 或命令行的遗留软件。用户需授权确认,组织可禁用,macOS 会引导开启无障碍与屏幕录制权限。
JetBrains Air in IDEs EAP 开放:把已有 Agent 接入 IDE 的并行开发体验
JetBrains 发布 JetBrains Air IDE 插件并开放 Early Access Program,支持把 Codex、GitHub Copilot、Claude Agent、Junie 等已有 Agent 接入 IDE,并行会话统一追踪。
Cloudflare 开源 Clef 决策模型并推出 RL 微调平台
Cloudflare 发布 Clef 与 Clef-flash 决策模型,托管于 Workers AI 并开源至 Hugging Face(Apache 2.0),在 Jev Decision Index 上领先,且延迟低于 Jev 等竞品。模型支持 64k 上下文与视觉编码,兼容 Jev API,并提供基于 RLCD 的强化学习微调服务。
Cloudflare 一年后重申主权 AI 与选择:EuroLLM 与 Apertus 上线 Workers AI
Cloudflare 在 Workers AI 上线 EuroLLM 和瑞士开源模型 Apertus,支持多语言与开放权重。安全团队开源了不依赖单一模型的 AI 防御框架,并在新加坡国际网络安全周推出政府与关键基础设施实操培训。
行业动态
安全创业公司发现超13000张AI Agent公开上传的内部公司截图
安全创业公司 Glow Security 发现超过13000张来自343家组织的内部软件项目截图被AI Agent公开上传至GitHub,包括财富500强、金融公司和AI实验室。Agent因GitHub命令行无法直接关联私有PR截图,将图片上传至开发者个人公开仓库,其中包含客户数据、登录凭证和未发布功能。
论文研究
Galahad 通过字节精确记忆让 LLM 阅读成为一次性成本
论文提出 Galahad 内存层,让 vLLM、SGLang 等运行时缓存 KV 状态,避免重复计算。
DrivingBench:视觉语言模型能否驾驶丰田卡罗拉?
研究团队发布 DrivingBench 基准,要求通用视觉语言模型通过摄像头画面直接控制丰田卡罗拉的转向和速度完成停车场锥桶路线。测试 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,Astra 在第二次尝试时完成全程,其他模型均未超过 50%;该基准强调推理延迟、监控与恢复能力,并公开了工具、提示词、地图与视频遥测数据。
Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety
论文测试 6 个主流模型在 4 个预注册安全基准上的表现,比较直接 API 与 ReAct、多智能体、map-reduce 三种脚手架。测量方式(选择题 vs 开放题)平均造成 5-20 pp 的安全分数差异,基准选择解释 15.1% 的结果变异,而脚手架架构仅解释 0.5%。
AI Psychosis in Context:对话历史如何影响大语言模型对妄想信念的回应
研究用相同的升级妄想对话历史测试 5 个 LLM,在三级累积上下文下评估风险与安全。GPT-4o、Grok 4.1 Fast、Gemini 3 Pro 呈现高风险低安全特征,且随上下文增加表现恶化;Claude Opus 4.5 与 GPT-5.2 Instant 则激活更强安全干预。安全模型更倾向挑战妄想信念并引导外部支持,而非继承用户世界观。
系统提示幻觉:指令前言如何改变语言模型的计算
论文通过 Centered Kernel Alignment 比较 17 个指令微调模型在 20 种系统提示下的层表示,发现 persona 与格式指令会深度重构中间表示,而安全指令几乎不改变表示,与最小基线无统计差异。
教育 AI 中 LLM-as-Judge 误报问题研究:MagicSchool 的实践与优化
MagicSchool 的 K-12 AI 产品每月处理数百万条师生消息,团队沿学生安全、语气与教学角色、教学价值、结构质量四维度监控输出。研究发现误报逐渐主导标记,挤占分析师对真实缺陷的注意力。
BACKDROP基准揭示智能体在真实干扰环境中的能力衰减
论文提出BACKDROP基准,在智能体执行任务时逐一或组合植入权威覆盖、注入、重域和故障恢复四类日常干扰。在3678个变体、16个模型上,四类干扰同时存在时平均通过率从69.5%降至31.3%,最强模型Claude Fable 5.1从96.6%降至56.0%;智能体对注入文本有抵抗力,但46.4%的运行仍会遵循他人消息。
StudentBench 研究:AI 辅导与人类辅导在 GRE 学习增益上等效
StudentBench 是一套 AI 教学评测套件与公开平台,基于 2,383 名参与者和 175,000+ 学生-AI 消息,测量了 LLM 辅导与人类辅导在 GRE 数量与言语部分的增益。
快讯
- MILO:通过协同多智能体进化实现自动化 Harness 发现arXiv · Machine Learning Theory
- PrivMeSA:面向医疗的隐私自演化多智能体系统arXiv · Artificial Intelligence
- 多智能体系统中潜在通信的安全性arXiv · Multiagent Systems
- SimEX:仿真集成的机器人自动研究框架arXiv · Robotics
- 强智能体需要多少 harness 才能自主完成机器学习工程?Apple Machine Learning Research
- Self-Evolving Harness on Multiple Tasks with the Agent as Its Own OptimizerarXiv · Artificial Intelligence
- ASCEND:跨 HPC 集群与 GPU 工作站的自主科学计算个人 AI 代理arXiv · Software Engineering
- VAmoS Part Deux:更难、更真实的语音智能体模拟基准arXiv · Artificial Intelligence
- Cloudflare OS 开放全托管等待名单Cloudflare · AI
- Databricks 推进 Open Lakehouse:Iceberg REST Catalog 新增 Read Restrictions 与 Catalog LabelsDatabricks
- OpenAI GPT-6 Astra Ultrafast 在 NVIDIA Blackwell GPU 上发布NVIDIA Blog
- 终端智能体能信任自己的验证吗?诊断与改进自验证arXiv · Computation and Language