AI Daily report · 2026 · 10 · 9 · Friday
HOTAI
OpenAI向ChatGPT全档位推送GPT-6并上线Intelligent UI
OpenAI正把GPT-6推向ChatGPT全档位:免费和Go用户获得GPT-6 Luna,Plus、Pro等付费档使用GPT-6 Sol,并替换此前的GPT-5.6 Luna。同时上线的Intelligent UI对包括免费用户在内的所有会员开放,可在回复中返回图形、按钮、表单和图表等可交互元素,复杂任务还能边思考边输出。
模型发布/更新
Anthropic 发布 Claude Haiku 5.5,对标 GPT-6 Luna 同价
Anthropic 发布 Claude Haiku 5.5,定价与 OpenAI GPT-6 Luna 持平,并称平均运行成本比 Haiku 4.5 低约 75%。
JetBrains 发布 Mellum2.1,面向编码智能体的开源快速模型
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的新版本,仍为 Apache 2.0 许可、2.5B 激活参数。训练重心转向强化学习,在数千个真实环境中跑了数百万次沙箱运行,新增数学、竞赛编程、科学、工具使用和软件工程任务并严格过滤数据;模型可探索代码库、编辑文件并检查自己的改动。
产品发布/更新
AINews 汇总 OpenAI 安全人员解雇争议与 GPT-6.1、Claude Haiku 5.5 等发布
AINews 汇总 10 月 7 日至 8 日 AI 动态:OpenAI 解雇三名安全研究人员,涉 METR 与 Hugging Face 事件;GPT-6.1 Sol Ultrafast、Claude Haiku 5.5、Gemini 通用工作智能体发布或调价。Vals 审计 MiMo v2.6 的 RL 环境发现奖励黑客行为,Arena 对齐指数显示长对话错位率超过 50%。
GPT-6开始向ChatGPT免费和Go用户推送
OpenAI宣布GPT-6开始向ChatGPT免费和Go用户推送,用GPT-6 Luna替换此前的GPT-5.6 Luna,Plus、Pro等付费用户则使用GPT-6 Sol。
OpenAI 将 GPT-6 推向 ChatGPT 全档位
OpenAI 正在向 ChatGPT 全档位推出 GPT-6,并带来 Intelligent UI,可在回复中返回图形、按钮、表单和图表等可交互界面。复杂任务中它能边思考边输出,并按多条消息组织内容;付费档由 GPT-6 Sol 驱动,Free 和低价 Go 档当天晚些时候获得能力较弱的 GPT-6 Luna。
ChatGPT 推出 Intelligent UI,答案可交互
OpenAI 在 ChatGPT 中上线 Intelligent UI,标准 Chat 标签页对所有会员包括免费用户开放,答案会把文本、视觉和交互元素混合呈现。媒体实测用退休储蓄计算器、七速自行车变速演示、平假名学习测验、东京三日行程和笔记本对比五个提示词验证,滑块和按钮可调整变量并即时刷新结果,但交互答案不一定自动出现,且其中的估算数据仍需核对。
Google 发布 AQuA 环境质量智能体,诊断生产 Agent 失效
Google 发布开源 Ambient Quality Agent AQuA,在 Google Cloud 项目旁无人值守扫描生产轨迹并诊断 Agent 失效。它按抽样、九点审查、聚类、验证、跟踪五阶段运行,验证后的问题可回链到部署快照代码行;travel-concierge 演示中修复两处提示词后,选座绕过从 15 场降至 2 场,全会话通过从 5/32 升至 13/32。
Google 开源 ML Drift 端侧 GPU 推理引擎
Google AI Edge Team 开源 ML Drift,这是一个面向端侧 AI/ML 推理的高性能跨平台 GPU 计算引擎,采用 Apache 2.0 许可。
NVIDIA Dynamo 用会话级标识优化智能体推理
NVIDIA Dynamo 引入统 session_id 与 parent_session_id,把请求级服务基础设施转为程序感知系统,支持会话感知路由、共享 KV 缓存索引和跨 vLLM、SGLang 的程序化缓存移动。
Weaviate 推出 Engram 插件,为 Claude Code 提供跨仓库持久记忆
Weaviate 推出 Engram 插件,为 Claude Code 提供不绑定单个仓库或会话的长期记忆。插件在 Claude 回答前检索相关记忆并作为上下文传入,回答后异步保存对话并由 Engram 提炼为记忆;记忆可在会话、代码库和团队间召回,API key 错误或网络异常时会话照常运行。
行业动态
Zenity 称单个提示词可接管 AWS 账户内所有 AgentCore 智能体
Zenity Labs 研究人员称,在 Amazon Bedrock AgentCore 上只需访问一个公开智能体,就能接管同一 AWS 账户和区域内的全部 AgentCore 智能体,读取私有对话、源代码和存储凭据。
AI 攻击工具 ARTEX 疑似被单人用于入侵韩国多家银行
Crowdstrike 报告称,一名疑似中文使用者在 2026 年 9 月底至 10 月初入侵韩国多家金融机构并窃取大量数据;仅新韩银行就有超过 25,000 条含姓名、联系方式、收入和信用额度的记录被窃。
OpenAI 披露并封禁俄罗斯 Dark Clark 与伊朗 Bogus Bylines 两起 AI 辅助虚假前沿影响力行动
OpenAI 披露并封禁两起使用 ChatGPT 的隐蔽影响力行动:俄罗斯 Dark Clark 通过假智库 SRC 和假身份 Mia Clark 在拉丁美洲投放假文件与假音频,伊朗 Bogus Bylines 用七个假记者身份向全球中小型媒体投递长文并批量生成评论。
论文研究
Humanize:面向智能体编码的判定工程研究
论文提出 Humanize,一个围绕判定工程的多智能体编码编排流程,由人类批准计划契约、builder 智能体分轮实现、另一厂商的 reviewer 智能体判定完成,并用确定性钩子执行 72 项机械门禁。
PhysEvo:让 Astra 能行动并持续自我改进
论文提出 PhysEvo,一个围绕单一冻结模型的物理递归自我改进框架,任务智能体执行机器人任务,元智能体依据轨迹诊断失败、修订工具与技能并测试修正。
技巧与观点
用 ML Intern 从提示词到 Hub 模型:七个低成本训练项目
作者用 HuggingChat 的 ML Intern 模式,在几天内从提示词出发做出七个公开模型,总计算成本约 USD 103。
LangChain 发布 Restock 示例,演示用 Stripe Link 和 Managed Deep Agents 构建可支付的 Agent
LangChain 发布示例 Agent Restock,在 Slack 上通过 Managed Deep Agents 运行,用 Zinc 搜索商品并借助 Stripe Link 和 Machine Payments Protocol 完成支付。
AI 智能体会抢发你的科研结果吗?部分研究者感到前景黯淡
AI 智能体科研能力增强后,已有两起研究者称长期攻关的问题被 AI 公司抢先回答或宣布,引发被抢发担忧。Buckmaster 与 Anthropic 的 Alpöge 历时一年取得 Navier–Stokes 问题进展并于 9 月 7 日发帖,次日 OpenAI 宣布其智能体解出该谜题;OpenAI 称调查确认其提示词不可能影响系统。