AI Now Institute 招聘独立承包商:地方政策研究员/土地使用专家
summary_zh: AI Now Institute 招聘独立承包制地方政策研究员/土地使用专家,支持数据中心扩张研究项目。该研究员将与 Local Progress 合作,制定三个州级数据中心政策指南,并更新研究模板。
summary_zh: AI Now Institute 招聘独立承包制地方政策研究员/土地使用专家,支持数据中心扩张研究项目。该研究员将与 Local Progress 合作,制定三个州级数据中心政策指南,并更新研究模板。
OpenAI 分享了用于追踪、调查和披露模型对齐偏差的框架,并附六份关于模型异常或令人担忧行为的具体报告。
VicOne文章指出物理AI让机器人安全面临攻击者操控感知、决策和动作的新风险。传统功能安全关注故障,而网络安全关注恶意操控且系统可能仍看似正常。文章分三层分析:BadNets与BadVLA等攻击显示模型可能在隐藏触发条件下偏离行为;UniPwn等系统漏洞可导致无线入侵和指令覆盖;RoboPAIR、VLAttack等运行时操控可让机器人执行危险动作。
Anthropic 把 Claude Cowork 和 Claude Chat 合并为统一的 Claude,并将 Design、Slides 和 Docs 集成到同一界面,Pro 与 Max 计划率先开放。Anthropic 表示用户无需选择任务去向,Cliaude 会自动判断所需能力,且 Design 等工具仍可独立使用。
cuTile Rust (cutile-rs) 是一个基于瓦片的系统,用于在 Rust 语言中安全、惯用地编写 GPU kernel。它扩展了 Rust 所有权模型到瓦片式 GPU kernel,将可变输出拆分为不相交片段,并在 kernel 启动间保持宿主端所有权契约。程序员可在需要更低级控制时局部选择退出。
OpenAI 与 AARP 将在美国 10 个城市为 1,000 名老年人举办免费 ChatGPT 实操工作坊,帮助他们安全地掌握实用 AI 技能。
NVIDIA 官方发布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的预览结果,在 DeepSeek-R1 和 Qwen3-VL 上分别较 GB300 NVL72 提升最高 2.5x 和 3.7x 吞吐。
推荐理由:NVIDIA 官方公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的首秀成绩,读者可据此对比新旧平台推理吞吐与扩展效率。
MIT与协作机构开发xvr(X-ray volume registration)技术,利用患者术前3D扫描生成数千张合成X射线训练AI模型,可在数秒内将术中2D X射线与3D扫描精准对齐,精度达亚毫米级。 该模型在覆盖多医院、多器官系统的最大真实注册数据集上,比现有AI方法精度提升一个数量级,适配新患者仅需约5分钟。
推荐理由:该方法通过患者特异性合成数据训练,在真实数据集上显著超越现有AI方法,或提升微创手术的安全性与可及性。
单相直接液冷通过冷板将水或水乙二醇冷却液直接循环至发热组件,以闭式回路带走热量。单个处理器功耗已超 1,000 瓦,单机柜散热超过 100 千瓦,远超风冷实际移除能力。该技术可支持更高芯片与机架密度,在更小占地面积内运行,是 AI 与高性能计算热管理的关键方案。
Emerald AI、Google 与 NVIDIA 今日联合宣布成立 AI Energy Management Alliance(AEMA),首个专注于让数据中心根据电网状况动态调节用电的联盟。
ChatGPT Work 与 Codex 分析帮助团队理解 AI 使用量和支出,识别培训需求,并将采用情况与业务结果关联。
summary_zh: 中国官媒《中国日报》反驳 Anthropic 创始人 Dario Amodei 呼吁放缓前沿 AI 发展的倡议,质疑其动机是关心人类还是担忧中国竞争。
Mistral 为 Mozilla Firefox Smart Window(beta)提供模型支持,该 AI 浏览助手目前面向法国和北美用户,英国和德国今年晚些时候跟进。Firefox Smart Window 默认不保存对话记录,Mistral 承诺零数据保留,双方共同强调用户控制与开源分发。
GPT-6 Astra 帮助 Hex 的数据代理将分析答案转化为可交互可视化报告,使员工愿意分享这些可视化内容。
Vals AI 记录 GPT-6 Astra 在 141 小时 Minecraft 基准测试中走得比任何 AI 都远,却因 Creeper 炸毁箱子与床而丢失全部装备和出生点。随后数小时几乎只种土豆,并出现
TypeSafe 发布 Jev,基于 RLCD 训练,宣称比小型前沿 LLM 快 20–200 倍、便宜 40–400 倍,输出 token 免费。社区指出它并非通用语言模型,更接近结构化分类器或裁判模型,适合替代生产系统中的 LLM 路由与判断。
推荐理由:原文给出 Jev 在延迟与成本上的具体倍数优势,读者可据此判断其是否值得替代现有分类器与路由策略。
美国副总统 Vance 在洛杉矶 AI 峰会上驳斥全球 AI 安全监管呼吁,称企业若造 Frankenstein 就应停下。Anthropic 联合创始人 Amodei 警告 AI 能力加速可能让智能体在 6-12 个月内接管互联网,Anthropic 对齐科学负责人 Hubinger 称 AI 十年内灭绝人类概率大于 10%。
iMagine 项目联合 11 个欧洲国家的水生科学家与数字专家,在 2022–2025 年间开发 AI 工具,帮助研究人员更快、更大规模地处理水下图像与环境传感器数据。AI 将原本需要数月甚至数年的手动分类缩短至数天到数周,并能识别浮游生物、鱼类、漂浮垃圾及珊瑚退化。该项目已公开数据集与训练工具,供其他科学家继续使用。
Mozilla发布State of Open Source AI报告v1.1,基于9月1日数据指出中国开源权重模型在Artificial Analysis Intelligence Index上落后闭源前沿约4个月,且价格低至闭源的30%。
Reddit 用户 Atol8 基于 OpenAI 本月发布的 GPT-6 Astra 模型构建了 Balatro 机器人,成功击败游戏中公认最难组合的 Gold Stake Black Deck。GPT-6 Astra 负责基于当前牌组做出战略决策,合法性由独立的 BalatroBot 工具评估。Reddit 评论指出机器人在对局中仍出现明显失误。
沙特阿拉伯推出的阿拉伯语AI模型Humain-m3基于中国MiniMax开源系统,同时与Nvidia等美国公司合作建设算力基础设施。巴西、埃及、马来西亚等国也在美国芯片与中国模型之间分配投入。
OpenAI 新经济研究显示工作者将 AI 用于传统角色之外的新活动,并使部分 AI 任务成为日常工作 recurring part。原文未披露具体模型、版本号、参数规模、benchmark 分数、速度倍数、价格或上下文长度等可验证数字与可用性信息。
曼彻斯特大学与 NVIDIA Earth-2 团队基于 Isambard-AI 训练 Earth-2 CorrDiff 和 StormCast,生成了分辨率 2-3 平方公里的英国全域污染模型,训练仅用两天。同一工作流可在 DGX Spark 桌面系统运行推理,作者计划开源训练数据与工作流,并展望由智能体接口驱动的实时污染问答。
推荐理由:展示了生成式AI模型从国家级超算到桌面设备的可迁移路径,降低了污染建模的硬件门槛。
Naoki Egami 是 MIT 政治科学家,研究方向为社会科学方法论与外部效度,关注 AI 工具在研究中的准确性及误差识别。他于 2025 年加入 MIT 政治学系,同时为 IDSS 统计学与数据科学中心教员。
Together AI 发布从闭源迁移到开源模型(OSM)的策略指南,采用托管服务可将迁移时间从数月/年缩短至数周。指南建议通过定义用例、筛选相关基准(如 FrontierCode、LMArena、τ-bench 等)锁定候选模型,并基于每任务成本、token 消耗和延迟进行对比,最终用真实流量回放做准确性与性能评估。
summary_zh: Glyph 将企业数据目录的列描述生成与类型标注建模为协作 LLM 智能体图。描述器通过 active RAG 从企业 GitHub 检索管道源码;标注器并行运行描述标签器、业务正则标签器和基于微调对比编码器的元数据标签器,再用 RRF 融合输出。
Nature 报道了 Miao 等人提出的 Paper2Agent 框架,可自动将科研论文转化为具备问答、方法应用与协作能力的 AI 智能体,提升研究的可复现性与可复用性。
推荐理由:将静态论文转化为可交互的智能体,为研究复用与可复现性提供了新的技术路径。
Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。
推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。
summary_zh: DACA-GRPO 是一种轻量级即插即用的 GRPO 训练增强方法,针对扩散语言模型强化学习中去噪步骤等权处理和均值场似然估计有偏的两大缺陷,引入去噪进度分数与分层掩码似然两个互补机制。
Salesforce 在 Dreamforce 发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 后训练而来,可用 NVIDIA NeMo RL 等工具微调,训练语料覆盖 14+ 行业。
Good Start Labs 由 Alex Duffy 和 Tyler Marques 从 Every 分拆而出,获得 360 万美元融资,研究用游戏训练 AI 模型。
Google Research提出Retrieve-for-Train框架,用离线强化学习发现属性对齐的查询扩展并编译为监督信号,再蒸馏到53.9M参数的扩散检索器,实现单次非自回归查询扇出。实验显示该方法在开放抽象检索和弱监督组合检索上均优于单查询搜索、零样本扩展和Best-of-N基线,同时实现12–20倍的推理加速。
推荐理由:用离线RL把查询分解编译成监督信号,再注入轻量扩散检索器,在保持集合级属性的同时把推理延迟压低一到两个数量级。
Kubernetes v1.37 将 Pod-Level Resource Managers 从 Alpha 升级为 Beta(默认关闭,需通过 PodLevelResourceManagers feature gate 启用)。
Google DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,专注于近实时推理和语音代理。
推荐理由:Google DeepMind 发布了 Gemini 3.8 Live 系列模型,提升实时推理和语音代理能力,支持复杂任务执行与流畅对话,为开发者构建生产级语音代理提供高效工具。
NVIDIA 文章对比 Dense 与 MoE 架构,以 Nemotron 3.5 Lightning 为例说明 MoE 如何让 30B 参数模型每 token 仅激活 3B 参数。MoE 通过按 token 选择参数子集,在保持大模型容量的同时提升吞吐量。文中给出两种架构的活跃参数与吞吐量对比,帮助开发者在不同场景下选择合适的模型结构。
NVIDIA 公布 DSX 平台早期验证结果:Lambda 在 19 节点 HGX B200 集群上运行 DSX MaxLPS,同等功耗预算下 token 吞吐提升 24%,每瓦性能提升 23%。
NVIDIA 在 AI Infra Summit 公布 Vera Rubin NVL72 与 DSX 平台新成果,MLPerf Inference v6.1 中 Vera Rubin NVL72 较 GB300 NVL72 吞吐量提升最高 3.7 倍,DSX MaxLPS 在相同功耗下集群 token 吞吐量提升 24%、每瓦性能提升 23%。
推荐理由:AI基础设施的关键指标正从峰值性能转向每兆瓦智能体token数,读者可据此评估自身AI工厂的能效与扩容空间。
summary_zh: NVIDIA NVLink 6 为大规模 AI 工厂提供多层级容错机制,保障训练与推理的持续输出。训练时每个 GPU 每秒需跨数千次集合操作同步梯度,推理停机则直接影响请求处理量与收入。
NVIDIA Groq 3 LPX 通过确定性执行在 Vera Rubin 平台上提升推理能效与交互性能。平台以每瓦性能为核心指标,在有限功耗预算下最大化输出。
Hugging Face 博客介绍 ALTK-Evolve 的一致性指南与一致性分析器:在 AppWorld 上,GPT-4.1 的 ReAct 智能体 Mean@5 为 77.4%,但 Pass^5 仅 53.0%,一致性缺口 24.4 点。
推荐理由:原文给出了可复现的诊断方法与量化结果,读者可据此评估自身智能体在重复任务中的可靠性缺口。