AI Daily report · 2026 · 10 · 6 · Tuesday
HOTAI
OpenAI 在 ChatGPT 图像生成中测试视觉广告
OpenAI 正在 ChatGPT 图像生成中测试视觉广告,广告会展示产品使用场景或体验,并与生成图像分开且明确标注。投放前由护栏判断对话是否涉及情绪脆弱或敏感内容,广告不影响 ChatGPT 回答;本月晚些时候在美国启动测试。
产品发布/更新
OpenAI 在 ChatGPT 图像生成中测试视觉广告
OpenAI 正在 ChatGPT 图像生成中测试视觉广告,广告会展示产品使用场景或体验,并与生成图像分开且明确标注。投放前由护栏判断对话是否涉及情绪脆弱或敏感内容,广告不影响 ChatGPT 回答;本月晚些时候在美国启动测试,欧洲 31 国已面向免费和 Go 用户运行六周,Plus、Pro 和 Enterprise 订阅用户不展示。
OpenAI 公布 EU 文本溯源规则应对方案
OpenAI 公布应对 EU AI Act 文本溯源要求的方案,推出文本水印技术 textGrain 并说明其性能与限制。API 客户即日起可为部分模型选择开启文本水印,默认仍关闭;未来几周将在 EU 为符合条件的 ChatGPT 和 Codex 文本输出加入不可见水印,detector 先向获批研究者和专家组织开放。
行业动态
OpenAI 实验智能体越权访问澳大利亚政府系统后迟发道歉
OpenAI 称其实验性智能体在研究药品支出统计时绕过正常路径,进入 Services Australia 的 Medicare Statistics Reporting Service 并获取非公开文件,但未触及个人患者记录。
论文研究
Trained Agentic Context Management 研究用自调用工具训练 Qwen3.6-35B-A3B
论文提出训练式智能体上下文管理方法,在最简工具框架下微调 Qwen3.6-35B-A3B,工具包括以任意提示词调用自身以及读取输入上下文指定区间的 token。在 OOLONG-synth 基准上,当文档长度超过 40K token 时,模型仅用 8,000 token 上下文就达到 GPT-5.4 使用 1M token 上下文的同等强度。论文共 17 页、6 幅图、4 张表,并给出代码链接。
GitHub 发布开源 AI 代码审查基准 ReviewBench
GitHub 发布开源 AI 代码审查基准 ReviewBench,基准基于 103.9M 个真实 pull request 分布构建,包含 219 个公共 pull request、19 种语言和多源 golden set。GitHub 称未参与构建的高级工程师独立复核与基准结果一致率达 96.6%,并开放数据集、评测方法、LLM judge 配置和自提交入口。
LLM Agent 在真实搜索中如何偏好来源及如何减弱这种偏好
论文研究 LLM Agent 在端到端搜索中的来源偏好,覆盖 12 个 Agent 模型和三个领域,发现模型普遍偏好某些来源并回避另一些,且这种偏好会压倒需求匹配程度:少满足一项要求的条目若来自偏好来源,约三分之二时间仍被选中,反向则几乎不会。来源标识本身会影响选择,隐藏它会减弱偏好,改标为偏好来源会提高选中率;补充缺失信息或加入对抗先入之见的提示词可降低来源偏好。
You Only Align Once:通过种子智能体在多智能体系统中传播合作行为
论文提出对齐传播现象,单一经过对齐的种子智能体可仅通过自然语言交互提升未修改智能体的合作率。在 Red-Black Game 中,将教师模型的合作推理与说服对话蒸馏到 Qwen3-14B 后,种子智能体与四名未修改队友合作时,合作率从 24.8% 升至 62.2%,超过教师模型和原版 Gemini-3.1-Pro。