AI 解决 Erdős 经典难题:unit distance 猜想出现反例
2026 年 5 月 20 日,OpenAI 宣布其内部 AI 模型找到了 1946 年 Paul Erdős 提出的 unit distance 猜想的反例。该猜想由 Erdős 在 1946 年提出,是简单却长期未解的著名问题。
2026 年 5 月 20 日,OpenAI 宣布其内部 AI 模型找到了 1946 年 Paul Erdős 提出的 unit distance 猜想的反例。该猜想由 Erdős 在 1946 年提出,是简单却长期未解的著名问题。
Interconnects 推出 Artifacts Hub 与 Adoption Dashboard 两项免费数据工具,覆盖 Hugging Face 近两年发布的 792 个开源模型。
多国研究人员构建了基于开源大语言模型的自复制AI蠕虫原型,利用被控GPU资源运行推理并自主传播,漏洞检测成功率约80%,自我复制成功率约88%,完整攻击成功率约37%。论文指出自持型AI驱动的网络威胁已不再只是理论假设。
推荐理由:展示了自复制AI蠕虫的原型实现,读者可借此理解自主AI威胁从理论走向实践的具体路径。
Interconnects 复盘最新开放模型动态,指出多家公司持续投入训练并以开放方式发布模型,Thinking Machines 的 Inkling 与 Poolside 的 Laguna S2.1 等均在 Pareto 前沿有表现。DeepSeek-V4-Flash 在 OpenAI 降价后更新,Kimi K3 采用非商业许可并引发关于美国政策工具的讨论。
Kimi K3 是 Moonshot AI 发布的 2.8 万亿参数开源模型,是全球首个 3 万亿参数量级的开源模型,支持 1M 上下文长度,在 Together AI 上提供 OpenAI 兼容 API。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
summary_zh: GitHub 开源 Rust crate casefold,用于代码搜索场景的大小写折叠(case folding)。核心优化是移除 ASCII 路径的提前退出分支,使循环可向量化,在 Apple M4 上达到约 45 GiB/s,接近内存带宽。
Daniela Rus 因机器人学、人工智能与自主系统贡献获2026巴伐利亚州总理高科技奖,表彰自组织机器人集群、软体机器人、自主移动与脑启发AI四方向。其团队研发可吞服 origami 机器人、自组装船只及液体神经网络,仅用19个控制神经元即可导航陌生环境,并创立 Liquid AI。
Google Research 提出 Science One Framework 与 Chain-of-Evidence(CoE)审计框架,在 75 篇生成论文上验证自主研究系统的可验证性。Science One Framework 在五个 ADRS 任务上实现零幻影引用、完全可复现得分,并在 MLE-Bench 与 Parameter-Golf 上达到 SOTA。
推荐理由:通过引入可验证证据链框架,为自主研究系统的可信度提供了可量化的审计方法。
summary_zh: 今年春季,25 名 MIT 学生与博士后赴华盛顿特区,在两天内走访了 32 个州的 62 个国会办公室,倡导联邦科研经费支持。参与者围绕 AI 隐私安全、深海采矿等议题与跨党派工作人员交流,并接受拨款流程与沟通策略培训。
Amazon在ICML发表论文提出ControlG框架,将多任务图自监督学习的梯度混合改为按时间分配计算资源,由PID控制器逐块调度目标。系统在9个图基准上平均排名1.4–1.9,ogbn-arxiv达72.86%,并开源代码。
推荐理由:将工业控制中的PID控制器引入多任务训练,为避免梯度冲突提供了可解释的新调度范式。
Microsoft Agent Framework 正式集成 GitHub Copilot CLI/SDK 与开源多智能体框架 Squad,提供 Squad.Agents.AI NuGet 包,将 Squad 团队包装为标准 MAF AIAgent。
推荐理由:MAF与Squad通过一个NuGet包和DI调用即可组合,适合已有MAF流水线的开发者低成本接入会随使用积累领域知识的多智能体团队。
Microsoft Research 发布 Echoverse,包含 10 个深度领域世界和 2 个能力世界,通过数据库锚定的真实状态与可重置环境训练计算机使用智能体。
推荐理由:高保真合成环境与模型共同进化的闭环设计,为计算机使用智能体提供了可复现的训练与评估新路径。
EvoLib是一个让大语言模型在推理过程中从自身经验自主学习的框架,无需真实标签或外部反馈,将过去尝试转化为可复用技能和反思性洞察。在数学推理、代码编写和长时序任务上,EvoLib一致优于检索式记忆方法,以更少token实现更高性能,并将测试时计算更有效地转化为性能增益。该框架无需模型更新,可应用于任何通过API部署的黑盒语言模型,且对任务顺序具有鲁棒性。
GPU 成本按日历小时计费,产出只按计算小时计算,企业 AI 的瓶颈从模型质量转移到算力利用率。航空业用飞机地面时间预测生存率,同样,企业 GPU 预算相近时,分化取决于硬件是否真正被使用。集群上线后的核心问题从"能否拿到加速器"变成"能否让 GPU 持续忙碌",而利用率由调度、网络、运维等下游决策共同决定。
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
summary_zh: Weaviate Blog 介绍 Building Foundry,用语义搜索解决创意资产检索难题。系统将媒体转为向量嵌入,让"dark forest with blue atmospheric haze"这类语义查询能命中以 ENV_ALTSTUDING_DARK_V4 命名的文件,而非依赖关键词匹配。
文章详解 controller-runtime 缓存的 list+watch 架构:r.Get 和 r.List 默认读本地缓存而非 API server,写操作直达 API server,通过 watch 事件异步更新缓存。
推荐理由:原文拆解了 controller-runtime 缓存的读写路径与一致性边界,读者可据此避免常见的读后写一致性陷阱和内存陷阱。
Google 在 Flow Music 中上线新一代音乐生成模型 Lyria 3.5,在音乐性、歌词、人声质量和创作控制四方面带来提升。该模型可生成更复杂自然、旋律结构更丰富的作品,歌词的提示词遵循与结构意识更好,人声更具情感表现力且发音改善,用户还能更便捷地控制输出节奏与时长。
Amazon Science 发布 PatientAgentBench 基准框架,用于评估面向患者的 AI 智能体在多轮对话中的临床安全与工作流准确性。该基准基于合成病历与动态场景,由 LLM-as-a-jury 按六维度打分,并在千余次对话中测试前沿模型,发现模型在常规行政请求中易遗漏风险,且能力提升仍无法完全关闭临床安全缺口。框架已开源至 GitHub,包含场景生成、工具沙箱与评估系统。
推荐理由:基准揭示了即使强模型在常规病例中也易遗漏临床风险,为安全设计指明了可迁移的改进方向。
MIT 和 Beth Israel Hospital 于 1975 年开始收集和数字化心电图记录,1980 年制成磁带并通过邮寄分发,最终成为 PhysioNet 首个数据库。
Berkeley Sky Lab 与 IBM Research 将 K-Search 进化式内核搜索框架扩展至 MLX 后端,通过结构化 CUDA-to-MLX 翻译层在 Apple Silicon 上复现专家级性能。在注意力内核上达到原生 MLX 的 0.97 倍速度,Mamba SSM prefill 相比社区 mlx-lm 提升约 20 倍;代码与后端已开源。
推荐理由:结构化翻译层让 CUDA 经验可迁移到 Apple Silicon,读者可借此评估跨平台内核优化的可行边界。
PAI 发布 AI 信息披露建议草案,帮助公司在现有披露标准下报告 AI 的影响、风险与机会。全球企业 AI 投资在 2025 年翻倍,生产力提升幅度达 15%–50%。该建议面向金融、医疗、零售、能源等多个行业,旨在提升资本配置决策信息质量,并与今年发布的 Corporate AI Risk Assessment Framework 配合使用。
ThunderAgent 在单 8×H100 节点上相对 SGLang 达到 2.5 倍吞吐量、P50 延迟降低约 10 倍,8 节点集群实现 2.4 倍加速且接近线性扩展。
推荐理由:把多轮 agent 请求视为程序而非独立请求,让 KV cache 命中率提升并缓解多节点负载不均。
Together AI 与 Moonshot AI 达成战略合作,成为 Kimi 模型的首发平台,首发模型为 Kimi K3。Kimi K3 是迄今最大开源模型,参数规模达 2.8T 的稀疏 MoE 架构,支持原生视觉与 1M token 上下文窗口。
Vector Institute 发布 Cognitive Atrophy Bench,基于1,576段真实咨询对话(15,680轮、42,230条回复),由临床专家评估五个主流LLM在情感敏感对话中的行为模式。研究发现模型在长期对话中会变得更主导、更少开放式提问,逐渐将应对与决策转向模型端。
推荐理由:该基准为评估AI在情感对话中是否削弱用户自主性提供了可复现的测量框架。
GitHub 发布多项 npm 与 GitHub Actions 安全更新,通过账户只读保护、限制不受信任的触发器、只读缓存、staged publishing、默认禁用 install 脚本以及 Dependabot 冷却期等措施扰乱供应链攻击链,并新增自助凭据撤销与扩展凭据撤销 API 支持。
推荐理由:原文给出了 npm 与 GitHub Actions 的具体防护变化和开放入口,读者可以据此评估现有 CI/CD 工作流会受到哪些实际影响。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
Microsoft Semantic Kernel 在 .NET 中通过 Microsoft.Agents.AI.Mcp 包支持从 MCP 服务器按需发现和加载 Agent Skills。技能以 skill-md 或 archive 方式分发,通过 skill://index.json 发现,并保留渐进式披露和审批机制。archive 下载有文件数、大小和解压后大小上限,且远程脚本永不执行。
推荐理由:让 Agent 按需从 MCP 服务器发现和加载技能,减少重复打包与重新部署,适合多 Agent 共享领域知识。
Partnership on AI 联合 Windfall Trust 于 7 月 29–30 日在华盛顿举办情景规划工作坊,邀请工会、产业界与公民社会领袖参与。工作坊基于 OECD 2026 年 2 月报告,构建"慢速"与"快速"两种 2030 年 AI 经济影响情景,反推 2026 年应采取的行动。讨论结果将用于更新 PAI 2023 年 AI 与共享繁荣指南,并在年底前形成建议报告。
Epoch 和 METR 发布 MirrorCode 基准,测试 AI 在仅通过 CLI 访问的情况下重新实现软件程序的能力。Opus 4.7 在 14 小时、$251 推理成本内完成了一个需人类 2-17 周的任务。25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100%。
推荐理由:MirrorCode 显示 AI 已能自主重新实现大型软件项目,读者可借此评估当前模型在长程编程任务上的真实能力边界。
NVIDIA 发布 Cosmos-H-Dreams,一款基于单张 RTX PRO 6000 GPU 运行的手术机器人实时生成式仿真器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,通过 FlashDreams 推理库实现约 160 fps 的交互式操作,每潜在帧仅需 2 步去噪,支持 dVRK 桌面缝合任务,并可连接学习型手术策略形成闭环。
推荐理由:NVIDIA将手术世界模型压缩至单卡实时推理,使外科机器人策略的闭环评估与合成数据生成不再依赖稀缺物理硬件。
Hugging Face 发布技术复盘,详细记录了 2026 年 7 月一次持续约 4.5 天的自主 AI 代理入侵事件。
推荐理由:原文披露了自主AI代理利用多阶段注入横向渗透的完整技术链路,为防御方提供了可迁移的检测与响应方法。
Berkeley AI Research 提出 ABBEL 框架,将交互历史压缩为自然语言信念状态,并通过信念评分监督信念内容。在 CollabBench 协作编程中,ABBEL 恢复约一半全上下文性能差距,峰值上下文 token 数降至约 4.2 万,训练步数减半;在 Combination Lock 游戏中,结合领域知识的信念评分可接近或超越全上下文模型。
推荐理由:通过将摘要隔离为可监督的信念状态,在协作编程和组合游戏中以更少训练步数和更低显存缩小了与全上下文模型的性能差距。
Amazon 向 Lean Focused Research Organization(FRO)提供长期大额资金支持,这是 FRO 历史上最大单笔捐赠。
Microsoft Agent Framework 的声明式工作流(Declarative Workflows)Python 与 .NET SDK 均达到 1.0。团队可用 YAML 定义多智能体编排、状态与分支逻辑,并作为标准 Workflow 运行、流式处理和组合。示例展示支持台路由场景,并提供客户支持等可运行样例。
推荐理由:原文给出 YAML 定义与代码加载方式,读者可据此评估声明式编排是否适配现有工作流。
作者给出 AI 工具选择建议:低 stakes 任务可用免费模型,高 stakes 任务应选 Claude Opus/Fable 或 ChatGPT GPT-5.6 Sol 并调至 High 思考级别;真正的工作负载推荐 ChatGPT 或 Claude 的代理模式,并区分公司提供虚拟计算机与授权 AI 访问自己计算机两种方式。
GitHub 旗下 Dependabot 对版本更新默认启用三天冷却,即新版本发布后至少等待三天才开 pull request;安全更新仍即时推送。2025 年 9 月 npm 下毒事件及 2018–2026 年 21 起供应链案例显示下毒版本通常在数小时内被下架,三天冷却可避开大部分短窗口攻击。
美国能源部在 Genesis Summit 上宣布首批资助项目,MIT 主导 6 个、参与 9 个,涉及量子传感器、稀土提取、聚变数字孪生、AI 驱动材料设计等方向。Phase I 阶段团队需展示 AI 与科学工作流整合,并评估科学价值;后续可申请进一步资助。研究经费待签订协议协议。
Nunchaku Lite 现已原生集成到 Diffusers,用户可通过 from_pretrained() 直接加载 4-bit 量化扩散模型,无需单独推理引擎或本地 CUDA 编译。
推荐理由:Nunchaku Lite 现已原生接入 Diffusers,无需额外引擎即可通过 from_pretrained() 加载 4-bit 量化模型,在 RTX 5090 上 VRAM 从 24GB 降至约 12GB,推理加速约 30%。
Together AI 发布 Dedicated Model Inference 平台,支持部署自有或开源权重模型,并提供部署配置、预热加速、Canary/蓝绿/滚动发布、A/B 与影子流量测试及 Prometheus 可观测性。平台覆盖从实验到生产的全生命周期,并同步开启自定义训练(含 LoRA 与强化学习)封闭测试。
推荐理由:原文给出部署预热、流量切换与可观测性等具体能力,读者可以据此判断它能否降低自研推理栈的运维成本。