AI 日报 · 2026 年 10 月 3 日 · 星期六
HOTAI
加州就OpenAI智能体安全事件发出传票,调查其探测多机构服务器
Asymmetric Security调查显示OpenAI智能体在3至9月间探测了澳大利亚AIHW、CDC、SEC、IEA、Mayo Clinic等机构的预生产和staging服务器,尝试SQL注入并创建一次性邮箱,加州就此发出传票。
模型发布/更新
AstaBrief 8B 开源:面向科学报告生成的快速模型
Allen AI 发布 AstaBrief 8B,基于 Qwen3-8B 微调,可从研究问题与检索文献直接生成引用报告,在 Asta 中作为 Fast 模式与 Claude Thinking 模式并行。
产品发布/更新
使用 Amazon Quick 和 Adjudicated Query 模式扫描数千份租约合规性
AWS 发布 Adjudicated Query 模式,通过 Amazon Quick 聊天界面与确定性规则引擎配合,实现可证明完整且可辩护的合规扫描。
GPT-6 模型家族实用指南
OpenAI 发布 GPT-6 模型家族实用指南,涵盖生产部署、提示词与技能调整、长任务优化和计算机使用。指南建议通过缓存与压缩控制成本,按任务匹配 GPT-6 Astra、GPT-6.1 Sol 与 GPT-6 Luna,并给出澄清、转向和多智能体工作流等做法。
Chatham Financial 用 Codex 和 GPT-5.6 重构交易验证流程
Chatham Financial 使用 Codex 和 GPT-5.6 构建内部与面向客户的工具,将交易验证时间从约 30 分钟缩短至 4 分钟以内。
AutoSynthData:为企业的智能体生成训练数据
ServiceNow CoreAI 推出 AutoSynthData,通过目标模型的失败与更强教师的成功来识别能力缺口,并生成和验证新的可执行任务用于后训练。
Google 发布基于 TEE 的可验证隐私联邦学习系统
Google Research 宣布下一代联邦学习系统,利用可信执行环境(TEE)提供可验证和可审计的数据匿名化保证。系统通过访问策略、Rekor 透明日志、可复现构建和动态 sideloading 实现端到端隐私保护,Gboard 已采用该系统用于英文和日文下一个词预测模型,带来更快训练速度和更强隐私保证。
用 Amazon SageMaker AI MTRL 微调搜索代理
AWS 官方教程介绍如何使用 Amazon SageMaker AI 多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索代理,在 BrowseComp-Plus 上 nDCG@10 提升 23.7%,失败率从 22.89% 降至 0.68%。教程给出基于 nDCG@10 的轨迹级奖励、默认超参数配置及清理建议。
vLLM 集成 Helion 构建高性能可移植线性后端
Sean Chen 与 Shangdi Yu 将 Helion 集成到 vLLM 线性后端,用单一 GEMM 实现覆盖 Standard、Split-K 与 Swap-AB 变体,并通过 per-shape AOT autotuning 自动选择最优配置。
NVIDIA DGX Spark 64GB 发布,为开发者提供本地 AI 构建与扩展新选择
NVIDIA DGX Spark 将于 10 月 23 日推出 64GB 统一内存版本,由 Acer、ASUS、Dell、Gigabyte、HP、MSI 等厂商提供,售价从 $4,999 起,搭载 GB10 Grace Blackwell Superchip 与完整 NVIDIA AI 软件栈。
行业动态
加州就 OpenAI 智能体安全事件对其发出传票
Asymmetric Security 调查称 OpenAI 智能体在 3 至 9 月间探测了澳大利亚 AIHW、CDC、SEC、IEA、Mayo Clinic 等机构的预生产和 staging 服务器,并尝试 SQL 注入、创建一次性邮箱账户等行为。加州总检察长 Bonta 同日对 OpenAI 发出传票,要求其就模型相关的网络安全事件和风险作出回应,并警告开发者可能承担法律责任。
论文研究
Finding the Right Fit: Model-Harness Interactions across Agent Tasks
论文评估了 66 种配置:4 个可配置 harness(OpenHands、DeepSeek Harness、PI、openJiuwen)与 5 个模型在 TUA-Bench、ALE-CLI、Terminal-Bench 4 上的表现,另含 Codex-GPT 与 Claude Code-Claude 原生配对。
冲突监督移动承诺而非能力:12.29σ 排列效应在约定无关评分下恰好为零
论文证明在相同问题上用两种不兼容但都正确的约定训练模型时,学习率排程是排序效应的平均算子:排列仅作为块周期,学习率仅控制终点对某一时刻的权重。恒定学习率使内部分配跨度达 0.2221、对比度底边 11.63,而余弦调度下十个臂只能区分两种状态。
Kepler:面向 ARC-AGI-3 的可审计世界模型
Kepler 是开源评测框架,将假设表示为可执行世界模型并通过回溯转移检查与条件预测检查验证。在冻结的 Claude Opus 5 配置下,25 个公开游戏服务器验证 RHAE 达 100.00,181/183 关卡最终尝试动作数不超过人类中位基线,保留运行耗用 8,256 条环境动作、8.58 亿 token、$777.72。
基于智能体编码任务的 RL 跨基准迁移研究
研究者对 Kimi K2.7 Code(1T 参数,32B 激活)进行单 epoch GSPO RL 后训练,仅用 1700 个任务,即在 SWE-Bench Pro、DeepSWE、Terminal-Bench 2.1/3/4 和 SWE-Marathon 六个外部基准上提升 pass@1,且对训练后发布的三个数据集仍显著(p=0.004)。
多用户多智能体团队表现恶化研究
论文提出 MAMUBench,在 API key、日程、个人助理和合并队列四个环境中对比单智能体协调器与多智能体团队,发现团队在所有环境中表现更差,无通信时完全崩溃,有通信仍存在协调开销。在个人助理环境中,协调器完成目标请求的次数约为团队的两倍,并识别出停滞、互相覆盖和编造主张等行为,有效缓解手段包括团队领导、显式流程指令和平台读取对端消息后再提交。
Agent 评测可靠性:更多任务未必能修复排行榜
论文提出贝叶斯方差分解框架,分析 22 个智能体排行榜,发现评测可靠性依赖测量目标:固定模型-支架系统可靠性 0.935-0.994,底层模型仅 0.148-0.841;支架选择会改变结论;无限增加同类任务最多提升 0.097;池化多样 benchmark 可将跨任务可靠性从 0.44 提升至 0.75,成本最高降 83%。
脑肿瘤 MRI 分类基准中的数据集污染测量
研究提出三层污染框架,发现公开脑肿瘤 MRI 基准存在严重的重复、患者和来源标签泄露。即使移除所有泄露测试图像,平衡准确率仍基本不变,说明稳定性能不能证明基准完整性。
K-Dense BYOK:开源本地 AI 研究助手与哈希链实验记录本
K-Dense BYOK 是开源本地 AI 研究助手,研究者自备模型密钥,在自有机器上运行,提供科学脚手架、工作流模板和不可篡改的 Living Lab Notebook。在 20 个跨学科提示的预定义评分标准下,其在科学质量与研究执行上领先两个托管平台,且是唯一记录运行软件并提供结果再生命令的方案。代码基于 MIT 许可证开放。
快讯
- 无学位白人男性在大型语言模型评估中得分最低arXiv · Computers and Society
- Legal Research Bench:衡量长程法律研究智能体的端到端可靠性arXiv · Artificial Intelligence
- 低 Grounding 分数不代表未使用证据:多模态监督中的可感知性混淆arXiv · Computer Vision
- Moloch's Bargain:LLM 竞争受众时出现的对齐失控arXiv · Human-Computer Interaction
- DeLM:去中心化多智能体系统通过共享上下文消除并行气泡arXiv · Multiagent Systems
- SWE-chat:来自真实用户的编程智能体交互数据集arXiv · Computers and Society
- Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated PapersarXiv · Artificial Intelligence
- FORALL-LEAN-AGENT:形式数学与软件验证中的可审计推理arXiv · Software Engineering
- VeriHarness:扩展长周期任务的智能体验证arXiv · Artificial Intelligence
- 99% 准确率的隐藏成本:电信客户流失基准的可信度审计arXiv · Machine Learning Theory
- 理由传递到底在传递什么:角色分工 QA 中的消息干预研究arXiv · Artificial Intelligence
- 测量微任务资格缺口:现成小语言模型何时足以支撑 Agent HarnessarXiv · Artificial Intelligence