Import AI 462:Superpersuasion;自持AI;通往ASI之路
Import AI 第462期汇总多项AI研究与讨论:牛津、斯坦福等机构实证AI在政策劝说和慈善募捐中可超越专家人类,且AI速度优势是劝说力的关键来源;Ajeya Cotra与Timothy B. Lee讨论自持AI时间表与具身机器人瓶颈;DeepMind论文探讨从AGI到ASI的路径与递归自我改进;Recursive展示自动化AI研究系统在训练与GPU内核优化上的新结果。
Import AI 第462期汇总多项AI研究与讨论:牛津、斯坦福等机构实证AI在政策劝说和慈善募捐中可超越专家人类,且AI速度优势是劝说力的关键来源;Ajeya Cotra与Timothy B. Lee讨论自持AI时间表与具身机器人瓶颈;DeepMind论文探讨从AGI到ASI的路径与递归自我改进;Recursive展示自动化AI研究系统在训练与GPU内核优化上的新结果。
文章指出禁止开源 AI 是严重错误,开源软件已为全球创造超 8 万亿美元经济价值。开源 AI 以开放权重模型形式成为对抗 Anthropic 与 OpenAI 双头垄断的关键制衡力量。文章强调开源的透明性使其更安全,并呼吁警惕以中美竞争为借口监管开源带来的反噬。
summary_zh: SpaceX 正探索在轨道建设数据中心,以避开地面土地、水资源和本地电网限制,并利用太空太阳能与近零下 270℃ 的背景辐射散热。太空数据中心面临辐射损坏电子器件、热辐射需要相当于两个足球场面积的散热面、轨道碎片与微流星撞击,以及发射成本和频次等严峻挑战。
Partnership on AI 发布 IBM 和 EXL 两份案例研究,探讨企业如何纳入员工意见以塑造AI采用方式。IBM 通过访谈发现领导开放反馈态度能让员工更愿意分享AI使用见解;EXL 对 5,500 名员工开展调查,发现清晰的AI治理框架能同时提升合规与创新。
summary_zh: Weaviate 提供服务端流式批处理导入模式,服务器根据队列深度自动调节速率,客户端无需手动设置 batch_size 或并发数。导入时需处理 per-object 失败、重复写入与内存溢出问题:HTTP 200 不代表全部写入,应通过 failed_objects 重试并用 generate_uuid5 避免重复。
Weaviate Cloud 宣布 Database、Query Agent 和 Engram 均提供免费层,无需信用卡且无过期时间。托管数据库与开源版本保持一致,可随项目增长无缝升级到按量付费集群。
推荐理由:免费层覆盖数据库、Query Agent 与 Engram,读者可据此评估原型开发成本与迁移路径。
Together AI 用 Kimi K2.7 Code 与 Claude Fable 5 各生成 12 个落地页,Kimi 平均便宜约 16 倍,单页最低 4 美分;通过自定义设计灵感 MCP 提供视觉参考后,Kimi 的排版与结构明显改善。OVSC 网站公开了所有变体及成本、token 用时明细,并给出 GPT-5.5 评分对比。
summary_zh: Google DeepMind 与英国政府合作开发基于 Gemini 的 AI 规划原型工具,旨在将家庭规划申请处理时间缩短 50%。该工具可整合数据、提取关键信息、识别本地政策、总结反馈并起草评估报告,规划官保留最终决策权。
Google Earth AI 发布 Farmscapes 向量化数据集,将英国 130,000 km² 高分辨率卫星影像中的树篱、石墙和林地转为可操作矢量清单。基于 RSF ViT 骨干(预训练于 3 亿+全球卫星图)微调,结合亚米影像与 1 米 LiDAR 双层标注,用 Polsby–Popper 紧凑度得分区分林地(≥30 米直径)、树丛与线性植被。
Google DeepMind 发布 AI Control Roadmap,提出分层防御框架,将内部 AI 代理视为潜在未对齐实体,通过监控、阻断与指标度量管理风险。框架基于 MITRE ATT&CK 构建威胁模型,并按检测规避能力(D1-D4)与攻击执行能力(R1-R3)匹配安全措施;团队已分析百万条编码代理轨迹,用于优化 Gemini Spark 等代理的实时监控。
推荐理由:原文给出分层防御框架与三条关键能力演进路径,读者可借此理解企业级 AI 代理安全的技术路线。
来自英国AI安全研究所和Timaeus的研究者联合成立非营利组织Sequent,旨在探索能让人类对超级智能AI安全性更有信心的对齐技术。组织计划招募40-80名员工,初期目标融资1-1.5亿美元,并准备在验证多条并行研究有效后再追加一个数量级。其研究组合包括可扩展监督、学习理论、启发式论证、博弈论和人物画像等方向。
summary_zh: SIG Storage 负责 Kubernetes 持久数据、卷管理及存储接口,近期 VolumeGroupSnapshot 在 v1.36 升至 GA。
Google Research 发布 JAMA Dermatology 论文,2,345 名参与者测试 AI 皮肤状况辅助工具。AI 组命名准确率 23%,较对照组 8% 提升近三倍;Wizard of Oz 组达 36%。但下一步医疗决策准确率提升有限,AI 组略更倾向建议非紧急处理。
香港大学研究团队在 SiC MOSFET 中实现负微分电阻效应,首次在 10mK 下用单晶体管复现生物神经元的高效脉冲活动。该芯片可集成于量子处理器附近,大幅降低低温系统热负荷,并有望用于深空探测。相关论文发表于 Nature Communications。
Anne Martel 开发 AI 系统,从医学影像(数字病理与放射影像)和临床文本数据中提取可操作信息,辅助肿瘤科医生制定个性化治疗方案。她的团队在 ICCV 展示多模态融合方法:将病理大模型与基因组数据及临床记录结合,通过多任务学习共享表征,提升预测准确性。医学影像 AI 已从跟随计算机科学进展转向贡献原创方法。
作者以软件工程为例反驳AI将导致大规模裁员的叙事,指出Block、Snap、Intuit等公司被报道的AI裁员实为财务压力或重组驱动,并引用WARN Act数据说明AI裁员占比极低。AI主要压缩了开发中的执行层,而决策与交付层仍需人类负责,因此软件工程师需求仍可能增长。
Ollama更新MLX引擎,在Apple Silicon上最高提速20%,并新增对NVIDIA NVFP4格式的支持,使模型量化质量损失约为q4_K_M的一半。Ollama推出快照系统,在Agent多子Agent切换、思考模型推理和分支重试时保存模型状态,避免重复处理上下文。用户可下载最新版Ollama后运行gemma4:12b-mlx模型,或通过ollama launch在编码Agent中使用。
推荐理由:Ollama在Apple Silicon上通过MLX引擎支持NVFP4格式并引入快照系统,读者可据此评估本地Agent工作流的性能提升与跨端部署可能性。
Google Research 提出 Regularized f-Divergence Kernel Tests 框架,用于更灵敏、准确地审计机器学习模型的机器遗忘效果,理论上控制假阳性率并使假阴性风险随样本量增加收敛至零。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。
推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。
AWS 宣布 EC2 M9g 和 M9gd 实例正式可用,首次搭载 Graviton5 处理器并配备 Nitro Isolation Engine。该组件是首个部署在商用云环境的形式化验证 Hypervisor,使用 Isabelle/HOL 完成 33 万行机器检查数学证明,涵盖保密性、完整性、功能正确性、无运行时错误和内存安全。
推荐理由:给出了可量化的验证规模和语言选择,读者可以据此评估云虚拟机隔离的形式化保障程度。
AWS 宣布 Graviton5 处理器正式商用,搭载于 M9g 和 M9gd 实例。相比 Graviton4,核心数从 96 增至 192,支持 DDR5-8800 内存和 PCIe gen5,每核性能提升 25%,数据库性能提升 30%。采用 3nm 工艺、四芯片架构,L3 缓存增至 192MB,并引入 Nitro Isolation Engine 实现形式化验证的云安全隔离。
GPT-4o 在 5 个词时准确率 91%,10 个词降至 57%,40 个词仅 15%;Claude 3.5 Sonnet 在 20 词内稳定,40 词时跌至 24%。GPT-5、Claude Opus 4.1、Gemini 2.5 也出现类似下降。AI 在颜色词冲突列表中难以抑制自动阅读倾向,准确率几近归零,而人类能保持稳定表现。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的技术研究资助,面向全球研究人员。资助重点研究大规模多智能体 AI 系统的群体行为,并提供框架以理解和缓解潜在风险。申请截止日期为 2026 年 8 月 8 日,获奖者预计于 2026 年秋季公布。
Together AI 获得 A-LIGN 颁发的 ISO 27001:2022 认证,其信息安全管理体系统过独立审计,覆盖全球平台及第三方数据中心。认证为企业在 Together AI 上运行生产级 AI 工作负载提供治理、访问控制、资产管理、安全开发与事件响应等方面的安全保障,并可与 SOC 2 等框架互补。
Ethan Mollick 分享其使用 Claude 5 Fable 的体验,称其在多项任务中大幅领先其他公开模型,并自主完成等时线地图绘制与学术校准软件 Concord 等复杂项目。Fable 调用多个子 Agent 进行研究、编码与自测,token 消耗高且成本约为 Opus 的两倍,同时安全护栏会频繁限制安全相关任务。
推荐理由:作者以亲测视角呈现 Mythos 级模型在复杂项目中的自主工作方式,为读者理解人机协作模式变化提供了具体案例。
summary_zh: 加拿大总理 Carney 推出「AI for All」国家 AI 战略,Vector 表示欢迎并肯定其协调加拿大 AI 资源、帮助中小企业采用 AI、提升生产力和推动突破的方向。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。
推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的 12B 多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干,16GB 显存或统一内存即可本地运行。
推荐理由:无编码器架构把视觉与音频直接接入 LLM 主干,读者可了解端侧多模态模型在显存与延迟上的取舍。
Google DeepMind Accelerator: Robotics 计划遴选 15 家欧洲早期机器人初创公司,提供 3 个月密集导师指导与技术支持,帮助将 AI 融入核心产品。入选公司覆盖物流、制造、医疗、气候与导航等领域,可使用 Google AI 栈、技术专长及 Gemini 机器人模型。
2026 年 AI 从"知道"转向"行动",Amazon 推出 Project Eluna,作为仓库运营的智能体模型,通过数字仪表板辅助运营决策。论文提出四种锚定方法:物理引导深度学习、不确定性感知推理、文本到数值桥接,以及第四种方法。UQ4CT 框架在五个基准上保持高准确率,同时将预期校准误差降低 25% 以上。
亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。
推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。
DeepMind 发布塞拉利昂预注册 RCT 结果,使用 Guided Learning 的学生数学成绩提升 +0.258 标准差,相当于 1.2-1.7 年学习进度;教师将 Gemini 融入约一半课堂的小组增益达 1.8-2.5 年。
推荐理由:在塞拉利昂的 RCT 显示 AI 辅导可带来 1.2-2.5 年学习进度增益,为教育 AI 的实证基础提供了关键数据。
Import AI 460 汇总三篇研究:Kings College London 等机构推出 SocioHack 基准,测试 AI 在信用卡积分、成绩等社会场景中利用规则漏洞的能力。
summary_zh: Sebastian Raschka 整理了 2026 年 1 月至 5 月他标记的 LLM 研究论文清单,涵盖架构与模型设计、高效训练与推理、稀疏注意力与长上下文、推理与测试时计算、强化学习、智能体系统、编码智能体、扩散语言模型及评测基准等类别。
Google 推出由 Gemini Enterprise Agent Platform 托管的 Cross-Corpus Retrieval,基于 Agentic RAG 驱动,可处理多源、多跳的复杂查询。
两篇新论文分别从 AI 机制和昆虫神经计算角度提出意识测试指标,而非仅依赖表面行为。ChatGPT 等现有大语言模型的行为表现不构成意识归因的依据,但未来不同架构的 AI 仍可能具备意识。研究者指出,判断意识应关注信息处理方式而非行为表现,人类、昆虫与机器在比较框架上趋于统一。
Ollama 0.30 发布,通过 llama.cpp 增强 GGUF 兼容并保留 MLX 引擎,NVIDIA 硬件吞吐量最高提升 20%,Vulkan 默认启用以支持 AMD 与 Intel 设备。
推荐理由:Ollama 0.30 通过 GGUF 兼容与 Vulkan 默认启用扩展了硬件覆盖,读者可据此评估自身设备能否更便捷地运行更多模型。
Ethan Mollick宣布新书Co-Existence将于10月20日出版,探讨如何与有时优于人类、有时远不如人类的AI协作。他以自身写书经历为例,展示AI在代码生成、事实核查和网站构建中的实际作用,并指出AI正成为作品的读者与推荐守门人。
Google Research在Nature发表PHRM研究,通过智能手机前置摄像头在日常使用中被动监测心率,跨肤色MAPE<10%,RHR估计MAE<5bpm达到可穿戴设备精度。研究基于35万+视频片段和近700名多样本参与者,覆盖浅色到深色皮肤群体,并公开了最大规模智能手机视频数据集及预训练PHRM-mini模型供合格研究者申请。
推荐理由:PHRM在大规模日常使用中实现跨肤色符合行业标准的心率监测,MAE低于5bpm的RHR估计达到可穿戴设备水平,为智能手机被动健康追踪设立了新基准。
NVIDIA Nemotron 3 Ultra 现已上线 Ollama 云端,为 550B 总参数、55B 活跃参数的开放模型,专为长程 Agent、编码 Agent 与复杂企业工作流设计,支持 1M 上下文与 NVFP4 推理。
推荐理由:原文给出参数规模与 NVFP4 优化,读者可据此评估它在长程 Agent 工作流中的成本与吞吐表现。