跳到正文

#OpenAI

今日 75 条
8月21日周五
8月17日周一
  1. Interconnects62

    Teaching Everyone to Fish for Tokens:开源模型生态的经济路径分析

    Nathan Lambert 讨论开源模型生态与 Linux 类比,指出开放权重模型更接近具体软件版本,而完整开源训练配方更接近操作系统。Nvidia 通过 Nemotron 推动近开源路线以扩大推理需求,但开源训练高度依赖其融资,未来几年需形成正向反馈。另一种可能是开源模型转向效率与专业化长尾,与闭源模型形成分化。

8月16日周日
8月12日周三
  1. IEEE Spectrum · AI73

    巴基斯坦法官对JudgeGPT的 verdict:大规模试验显示结案率提升6.3%

    巴基斯坦在咨询司法系统后,由经济学家Sultan Mehmood与合作者为1,559名法官推出定制工具JudgeGPT,结合GPT-4与约13万份巴基斯坦判例和法规的RAG知识库。试验发现经6次90分钟Zoom培训后,结案率中位数提升6.3%,上诉率微降,且培训不足者约一个月后停用。质量评估由GPT-5-mini和两位律师进行,但未报告幻觉率。

  2. Google Research66

    空货架还是丢失的钥匙?回忆是参数化事实性的瓶颈

    Google Research 提出知识剖析框架,发现前沿大模型的事实性错误主要源于回忆失败而非知识未编码。WikiProfile 基准包含 2,150 条维基百科事实,每个事实配 10 个问题,评测了 13 个 LLM 约 450 万条响应。

    推荐理由:该研究将大模型的 factual error 重新定义为 recall 失败而非 encoding 失败,并证明思考机制可恢复约四成到六成已编码但无法直接提取的事实。

8月11日周二
  1. Amazon Science72

    AWS Trainium Frontier 竞赛:在专用 AI 芯片上协同设计模型与内核

    AWS Trainium Frontier 竞赛邀请学术和工业界团队在 Trainium2 上从零训练语言模型,探索模型架构、优化器、训练循环与 NKI 自定义内核的全栈设计。

    推荐理由:AWS Trainium Frontier 竞赛让参与者在固定训练预算下从零训练语言模型,探索硬件原生架构与自定义内核的协同设计空间。

8月9日周日
8月3日周一
  1. Import AI80

    AI自复制蠕虫原型出现:Open-weight LLM + 定制化框架实现自主传播

    多国研究人员构建了基于开源大语言模型的自复制AI蠕虫原型,利用被控GPU资源运行推理并自主传播,漏洞检测成功率约80%,自我复制成功率约88%,完整攻击成功率约37%。论文指出自持型AI驱动的网络威胁已不再只是理论假设。

    推荐理由:展示了自复制AI蠕虫的原型实现,读者可借此理解自主AI威胁从理论走向实践的具体路径。

8月2日周日
8月1日周六
7月27日周一
  1. Import AI87

    Epoch 与 METR 发布 MirrorCode 基准测试:AI 系统完成长达一周的编程任务

    Epoch 和 METR 发布 MirrorCode 基准,测试 AI 在仅通过 CLI 访问的情况下重新实现软件程序的能力。Opus 4.7 在 14 小时、$251 推理成本内完成了一个需人类 2-17 周的任务。25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100%。

    推荐理由:MirrorCode 显示 AI 已能自主重新实现大型软件项目,读者可借此评估当前模型在长程编程任务上的真实能力边界。

7月24日周五
  1. Ethan Mollick · Notes72

    Ethan Mollick 撰写的 AI 工具选择指南

    作者给出 AI 工具选择建议:低 stakes 任务可用免费模型,高 stakes 任务应选 Claude Opus/Fable 或 ChatGPT GPT-5.6 Sol 并调至 High 思考级别;真正的工作负载推荐 ChatGPT 或 Claude 的代理模式,并区分公司提供虚拟计算机与授权 AI 访问自己计算机两种方式。

7月20日周一
7月18日周六
7月6日周一
7月4日周六
  1. Lilian Weng77

    Harness Engineering for Self-Improvement

    Lilian Weng 梳理了 harness 工程如何支撑递归自改进(RSI),将 harness 定义为围绕基础模型的运行时系统,负责编排执行、工具调用、上下文管理、状态持久化与结果评估。

    推荐理由:原文系统梳理了 harness 工程的设计模式与优化路径,读者可借此理解自改进循环中非模型层的角色与边界。

7月1日周三
6月30日周二
  1. Together AI75

    Together AI 在 ICML 2026 发布九篇全栈前沿研究论文

    Together AI 在 ICML 2026 发布九篇论文,覆盖智能体、模型塑造、算法优化、系统优化与内核五个层级。DSGym 提供 1000+ 任务统一评估框架,ThunderAgent 提升 1.5–3.6 倍智能体吞吐,TTT-Discover 用开源 120B 模型在数学、GPU 内核、算法和生物领域取得新纪录。

    推荐理由:九篇论文覆盖从智能体到 GPU 内核的完整栈,读者可据此判断哪些层是当前性能瓶颈。

6月23日周二
  1. Mistral AI64

    Mistral OCR 4 发布

    Mistral 发布 OCR 4,支持 170 种语言的单容器自托管文档解析,返回边界框、区块分类与内联置信度。

    推荐理由:独立标注者平均 72% 偏好 OCR 4,配合单容器自托管与结构化输出,为企业 RAG 和智能体工作流提供了兼顾数据主权与提取精度的 OCR 方案。

6月17日周三
6月15日周一
  1. Import AI66

    Sequent成立:研究者因对齐未就绪而创办安全初创

    来自英国AI安全研究所和Timaeus的研究者联合成立非营利组织Sequent,旨在探索能让人类对超级智能AI安全性更有信心的对齐技术。组织计划招募40-80名员工,初期目标融资1-1.5亿美元,并准备在验证多条并行研究有效后再追加一个数量级。其研究组合包括可扩展监督、学习理论、启发式论证、博弈论和人物画像等方向。

6月5日周五
  1. ScienceDaily · AI33

    科学家严肃探讨蜜蜂与 ChatGPT 是否具有意识

    两篇新论文分别从 AI 机制和昆虫神经计算角度提出意识测试指标,而非仅依赖表面行为。ChatGPT 等现有大语言模型的行为表现不构成意识归因的依据,但未来不同架构的 AI 仍可能具备意识。研究者指出,判断意识应关注信息处理方式而非行为表现,人类、昆虫与机器在比较框架上趋于统一。

5月27日周三
5月17日周日
  1. Google DeepMind62

    Google 扩展内容透明度工具,SynthID 验证进入搜索与 Chrome

    Google 正在把内容透明度与验证工具扩展到搜索、Gemini、Chrome、Pixel 和 Google Cloud。SynthID 已为超过 1000 亿张图片和视频、6 万年音频加上水印,Gemini 应用中的验证功能已被使用 5000 万次,并将在未来几周扩展到搜索和 Chrome。

    推荐理由:原文列出了 SynthID 与 C2PA 在搜索、Chrome、Pixel 上的落地范围,可据此判断内容溯源的行业分工。

5月14日周四
5月8日周五
4月30日周四
4月24日周五
  1. Together AI70

    Together AI 发布分布感知推测解码 DAS,RL 展开加速最高 50%

    Together AI 推出分布感知推测解码(DAS)框架,通过自适应后缀树推测器和长度感知调度,在数学和代码 RL 后训练中分别实现 50% 和 25% 的展开时间缩减,且不损失奖励质量。https://www.together.ai/blog/distribution-aware-speculative-decoding

    推荐理由:原文给出了无损加速框架和实验数据,读者可据此评估是否在自己的 RL 后训练流程中引入 DAS。

4月1日周三
  1. Together AI44

    Together AI 内核团队如何用 FlashAttention 和 ThunderKittens 重塑 AI 基础设施

    Together AI 的内核团队在 2022 年阵亡将士纪念日假期发布 FlashAttention,实现 2–3 倍加速。2025 年 3 月团队约 15 人,用一周时间基于 ThunderKittens 在 Blackwell 上开发出比 cuBLAS 快 2 倍的 FP4/FP8 GEMM 内核。团队采用学术与产业协同模式,成员来自 UCSD、普林斯顿、Caltech 等。

3月17日周二
3月16日周一
3月12日周四
3月11日周三
  1. Together AI64

    Together AI 在 Day 0 上线 NVIDIA Nemotron 3 Super

    Together AI 将 NVIDIA Nemotron 3 Super 带给开发者,模型为 120B 参数(12B 激活)的混合 MoE 架构,支持 1M token 上下文和多 Token 预测,并在 AIME 2025 与 SWE Bench Verified 上达到领先精度。

    推荐理由:原文同时给出单GPU部署和1M上下文等具体能力,读者可据此判断它能否直接承载多智能体与大上下文推理工作流。

3月5日周四
3月2日周一
2月6日周五
  1. Together AI71

    LLM 在无提示约束下会生成什么:近无约束生成行为研究

    Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。

    推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。