跳到正文

全部动态

今日 433 条
6月29日周一
6月27日周六
  1. Google Research59

    Pixel上通过冻结MTP加速Gemini Nano模型

    Google Research在Pixel 9和10上部署冻结多Token预测架构,通过将MTP头附加到已冻结的Gemini Nano v3模型实现端侧加速。该架构利用零拷贝设计,MTP头直接交叉关注主模型KV缓存,在通知摘要和校对任务中提速50%以上,每实例节省130MB内存。

6月26日周五
6月25日周四
  1. MIT News · AI62

    MIT 与 Microsoft 提出 Murakkab 系统,提升 AI Agent 工作流的速度与能效

    MIT 和 Microsoft 研究人员开发了 Murakkab 系统,开发者可用自然语言描述意图,系统自动选择模型、工具并动态配置硬件资源。测试显示,该方法在视频问答和代码生成任务中仅用约 35% 的计算量、27% 的能耗和不到 25% 的成本,同时满足性能要求。

    推荐理由:原文给出了具体优化幅度和动态配置方法,读者可以据此评估云上 Agent 工作流的能效潜力。

  2. Google DeepMind60

    Gemini 3.5 Flash 新增计算机使用功能,支持构建跨平台智能体

    Gemini 3.5 Flash 内置计算机使用能力,开发者可通过 Gemini API 和企业平台构建跨浏览器、移动端与桌面的自定义智能体。该功能此前仅作为独立的 Gemini 2.5 计算机使用模型提供,现原生集成至 Flash 模型,并配备提示注入对抗训练及可选的企业安全防护系统。

    推荐理由:计算机使用功能从独立模型整合进3.5 Flash,开发者可通过API和企业平台构建跨浏览器、移动端与桌面的自定义智能体,并配备提示注入防护与企业级安全机制。

6月24日周三
  1. Lilian Weng58

    Scaling Laws, Carefully:缩放律的实证回顾与拟合陷阱

    Lilian Weng 回顾了深度学习缩放律的演进:从早期学习曲线幂律,到 Kaplan 等(2020)提出大语言模型缩放律,再到 Chinchilla(Hoffmann 等 2022)重新论证计算最优分配,并讨论数据受限与重复数据下的修正方案。Kaplan 认为应更大模型、更少数据;Chinchilla 主张模型与数据等比例增长;后续工作进一步指出嵌入参数计数、数据重复和拟合方法会显著影响结论。

6月23日周二
  1. Mistral AI64

    Mistral OCR 4 发布

    Mistral 发布 OCR 4,支持 170 种语言的单容器自托管文档解析,返回边界框、区块分类与内联置信度。

    推荐理由:独立标注者平均 72% 偏好 OCR 4,配合单容器自托管与结构化输出,为企业 RAG 和智能体工作流提供了兼顾数据主权与提取精度的 OCR 方案。

  2. MIT News · AI62

    MIT发布Gleanmer芯片,低功耗实时3D建图助力小型机器人

    MIT研究人员发布名为Gleanmer的系统级芯片,仅消耗约6毫瓦功率即可实时构建详细3D地图,功耗仅为现有最佳建图芯片的2.5%。芯片采用高斯椭球(Gaussian)替代传统体素表示,并结合单遍生成与高斯融合算法,大幅降低内存与功耗,可帮助小型无人机在工业HVAC系统等复杂环境中避障规划路径。

    推荐理由:算法与硬件协同设计让低功耗实时3D建图成为可能,为小型自主机器人和轻量AR设备提供了新的能效路径。

  3. Together AI66

    ParallelKernelBench:前沿大语言模型尚不能编写高效多GPU内核

    Together AI发布ParallelKernelBench(PKB)开源基准,包含87个来自真实代码库的多GPU内核生成问题,要求模型用CUDA内核替代PyTorch+NCCL并通过NVLink直接通信。

    推荐理由:基准揭示前沿模型在多GPU内核生成上正确率与速度优势均有限,为分布式优化研究提供了可复现的测试平台。

6月22日周一
  1. Interconnects82

    GLM-5.2 是开放智能体的关键一步

    Nathan Lambert 亲测 GLM-5.2 后认为,它是首个在编码 harness 中表现可靠的开放权重通用智能体模型,Arena 评测中已能比肩 Claude Opus 4.8 的 max 模式。社区反响强烈,作者将其与 DeepSeek R1 类比,并指出这会给 Anthropic 带来定价压力,同时让开放模型经济迎来拐点。

    推荐理由:作者以亲测视角说明 GLM-5.2 在编码智能体工作流中的可用性,为读者判断开放模型何时能替代闭源前沿模型提供可迁移观察。

  2. Import AI74

    Import AI 462:Superpersuasion;自持AI;通往ASI之路

    Import AI 第462期汇总多项AI研究与讨论:牛津、斯坦福等机构实证AI在政策劝说和慈善募捐中可超越专家人类,且AI速度优势是劝说力的关键来源;Ajeya Cotra与Timothy B. Lee讨论自持AI时间表与具身机器人瓶颈;DeepMind论文探讨从AGI到ASI的路径与递归自我改进;Recursive展示自动化AI研究系统在训练与GPU内核优化上的新结果。

6月19日周五
  1. Interconnects23

    禁止开源 AI 将是一个错误

    文章指出禁止开源 AI 是严重错误,开源软件已为全球创造超 8 万亿美元经济价值。开源 AI 以开放权重模型形式成为对抗 Anthropic 与 OpenAI 双头垄断的关键制衡力量。文章强调开源的透明性使其更安全,并呼吁警惕以中美竞争为借口监管开源带来的反噬。

  2. ScienceDaily · AI40

    SpaceX 计划在太空建造 AI 数据中心,可行吗?

    summary_zh: SpaceX 正探索在轨道建设数据中心,以避开地面土地、水资源和本地电网限制,并利用太空太阳能与近零下 270℃ 的背景辐射散热。太空数据中心面临辐射损坏电子器件、热辐射需要相当于两个足球场面积的散热面、轨道碎片与微流星撞击,以及发射成本和频次等严峻挑战。

  3. Partnership on AI22

    当企业倾听员工对AI的意见时,每个人都受益

    Partnership on AI 发布 IBM 和 EXL 两份案例研究,探讨企业如何纳入员工意见以塑造AI采用方式。IBM 通过访谈发现领导开放反馈态度能让员工更愿意分享AI使用见解;EXL 对 5,500 名员工开展调查,发现清晰的AI治理框架能同时提升合规与创新。

6月18日周四
  1. Weaviate Blog34

    Weaviate 大规模数据导入与向量化指南

    summary_zh: Weaviate 提供服务端流式批处理导入模式,服务器根据队列深度自动调节速率,客户端无需手动设置 batch_size 或并发数。导入时需处理 per-object 失败、重复写入与内存溢出问题:HTTP 200 不代表全部写入,应通过 failed_objects 重试并用 generate_uuid5 避免重复。

6月17日周三
  1. Google Research35

    Google Earth AI 发布 Farmscapes 高分辨率向量化乡村生态地图

    Google Earth AI 发布 Farmscapes 向量化数据集,将英国 130,000 km² 高分辨率卫星影像中的树篱、石墙和林地转为可操作矢量清单。基于 RSF ViT 骨干(预训练于 3 亿+全球卫星图)微调,结合亚米影像与 1 米 LiDAR 双层标注,用 Polsby–Popper 紧凑度得分区分林地(≥30 米直径)、树丛与线性植被。

6月16日周二
  1. Google DeepMind67

    Google DeepMind 发布 AI Control Roadmap 框架,阐述 AI 代理安全防御体系

    Google DeepMind 发布 AI Control Roadmap,提出分层防御框架,将内部 AI 代理视为潜在未对齐实体,通过监控、阻断与指标度量管理风险。框架基于 MITRE ATT&CK 构建威胁模型,并按检测规避能力(D1-D4)与攻击执行能力(R1-R3)匹配安全措施;团队已分析百万条编码代理轨迹,用于优化 Gemini Spark 等代理的实时监控。

    推荐理由:原文给出分层防御框架与三条关键能力演进路径,读者可借此理解企业级 AI 代理安全的技术路线。

6月15日周一
  1. Import AI66

    Sequent成立:研究者因对齐未就绪而创办安全初创

    来自英国AI安全研究所和Timaeus的研究者联合成立非营利组织Sequent,旨在探索能让人类对超级智能AI安全性更有信心的对齐技术。组织计划招募40-80名员工,初期目标融资1-1.5亿美元,并准备在验证多条并行研究有效后再追加一个数量级。其研究组合包括可扩展监督、学习理论、启发式论证、博弈论和人物画像等方向。

6月13日周六
6月12日周五
6月11日周四
  1. Google DeepMind64

    Google DeepMind 发布 DiffusionGemma:4 倍加速的并行扩散文本生成实验模型

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。

    推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。

6月10日周三
  1. Amazon Science76

    AWS EC2 M9g 实例推出经形式化验证的隔离引擎

    AWS 宣布 EC2 M9g 和 M9gd 实例正式可用,首次搭载 Graviton5 处理器并配备 Nitro Isolation Engine。该组件是首个部署在商用云环境的形式化验证 Hypervisor,使用 Isabelle/HOL 完成 33 万行机器检查数学证明,涵盖保密性、完整性、功能正确性、无运行时错误和内存安全。

    推荐理由:给出了可量化的验证规模和语言选择,读者可以据此评估云虚拟机隔离的形式化保障程度。

  2. Google DeepMind44

    Google DeepMind 联合 Schmidt Sciences 等机构投资多智能体 AI 安全研究

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的技术研究资助,面向全球研究人员。资助重点研究大规模多智能体 AI 系统的群体行为,并提供框架以理解和缓解潜在风险。申请截止日期为 2026 年 8 月 8 日,获奖者预计于 2026 年秋季公布。

  3. Together AI22

    Together AI 通过 ISO 27001:2022 认证

    Together AI 获得 A-LIGN 颁发的 ISO 27001:2022 认证,其信息安全管理体系统过独立审计,覆盖全球平台及第三方数据中心。认证为企业在 Together AI 上运行生产级 AI 工作负载提供治理、访问控制、资产管理、安全开发与事件响应等方面的安全保障,并可与 SOC 2 等框架互补。

6月9日周二
  1. Google DeepMind61

    Gemini 3.5 Live Translate:流畅自然的语音翻译

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。

    推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。

  2. Amazon Science47

    Project Eluna:智能体 AI 的物理世界锚定

    2026 年 AI 从"知道"转向"行动",Amazon 推出 Project Eluna,作为仓库运营的智能体模型,通过数字仪表板辅助运营决策。论文提出四种锚定方法:物理引导深度学习、不确定性感知推理、文本到数值桥接,以及第四种方法。UQ4CT 框架在五个基准上保持高准确率,同时将预期校准误差降低 25% 以上。

  3. Amazon Science77

    亚马逊研究提出意图执行差距框架并开源 Simple Strands Agent

    亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。

    推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。