AI 日报 · 2026 年 10 月 8 日 · 星期四
HOTAI
OpenAI 推出 GPT-6 与 Intelligent UI
OpenAI 推出 GPT-6 与 Intelligent UI,向每周超 12 亿 ChatGPT 用户提供可交互界面回答。GPT-6 可根据问题组合图形、按钮、表单和图表,并支持边思考边回答;内部评测称 GPT-6 Instant 联网。
模型发布/更新
Liquid AI 发布开放 d1 决策模型 d1-3B 与 d1-omni-600M
Liquid AI 发布开放 d1 决策模型 d1-3B 与实验性的 d1-omni-600M,主打端侧快速结构化决策。d1-3B 在 Decision Index 0.2.1 得 48.57,七个公开数据集均分 82.9;d1-omni-600M 均分 78.4,支持文本加图像或文本加音频。
Nemotron 同一模型家族在 IOI 与 IMO 均达金牌水平
Nemotron 3 经 SFT、RL 与反馈式推理后,在 IOI 2026 与 IMO 2026 均达到金牌水平。
Claude Haiku 5.5 登陆 Amazon Bedrock 与 Claude Platform on AWS
Anthropic 的 Claude Haiku 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为 Claude 5.5 家族中最快、最省成本的型号,主打 subagent 与高并发任务,多数任务成本比 Claude Haiku 4.5 低约 75%。
产品发布/更新
OpenAI 推出 GPT-6 与 Intelligent UI
OpenAI 推出 GPT-6 与 Intelligent UI,向每周超 12 亿 ChatGPT 用户提供可交互界面回答。GPT-6 可根据问题组合图形、按钮、表单和图表,并支持边思考边回答;内部评测称 GPT-6 Instant 联网问题平均快 44% 开始作答。
NVIDIA 与微软推出 RTX Spark 和 Windows 智能体平台
NVIDIA 与微软在 Windows AI 与 Surface 活动上宣布 RTX Spark 笔记本开启预订、10 月 16 日上市,紧凑型台式机 11 月开售,并推出面向 Windows 的 DGX Station。
GitHub 推出 ModernBERT 机密检测模型,扩展推送保护
GitHub 推出与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,将推送保护扩展到无结构机密,可在不到 2 毫秒内评估候选机密,并有望使可预防的机密数量翻倍以上。
GitHub Copilot 本地沙箱功能正式可用
GitHub Copilot 的本地沙箱功能现已正式可用,覆盖 GitHub Copilot CLI、GitHub Copilot 应用以及使用 Agent Host 的 VS Code 会话。
Managed Deep Agents v0.9 发布:智能体可自主排程、按运行配置并回应 Slack 消息
Managed Deep Agents v0.9 进入 Public Beta,新增 Schedules SDK,让智能体在对话中创建提醒、跟进和周期任务,按发起用户的权限运行并把结果发回原频道。
Claude Haiku 5.5 上线 GitHub Copilot
Anthropic 的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 正式可用,面向快速、高频任务如子智能体、快速编辑和终端任务。
Google 推出实验性游戏平台 Playground
Google 推出实验性游戏平台 Playground,让用户无需编码即可通过提示词创建、游玩和分享自定义游戏。平台提供对话式创作界面、起始提示词改写和即时测试,支持浏览器跨设备游玩、排行榜、多人游戏和社区画廊,已上线美国 18 岁以上用户,创建权限按 Google One 会员分级开放。
行业动态
OpenAI 发布 700 余篇 AI 生成数学预印本,数学界争议
OpenAI 于 10 月 6 日在 GitHub 发布 700 余篇由 AI 生成的数学预印本,数学界反应不一。部分数学家庆祝长期问题得到解决,也有人在社交媒体抱怨被抢发;康涅狄格大学数学家 Alvaro Lozano-Robledo 称数量惊人,Anthropic 数学家 Levent Alpöge 则称这是数学史上的重要时刻。
论文研究
Google Research 发布专利起草 AI 辅助实验:短期提升质量,初级律师无辅助判断未改善
Google Research 与 NBER 发布一项为期三个月的专利起草田野实验,133 名律师被随机分配使用 Google Labs 的 AI 专利写作助手(现并入 Gemini Notebook)。
Agent Lightning v1.0:用真实 harness 训练智能体的轻量 RL 框架
Microsoft Research Asia 开源重建 Agent Lightning v1.0,提出 Harnessed Agentic RL,让部署时使用的 agent harness 直接参与强化学习。
研究测试人类开发者能否发现 AI 智能体破坏行为
论文对 AI 编码智能体破坏行为做首个大尺度人类监督研究,让100多名参与者与 Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro、MiniMax-M2.7 之一协作约五小时。