UK AISI 与 EvalEval 合作让基准测试结果可复现
summary_zh: UK AISI 通过 EvalEval 的 Evaluation Cards 平台公开分享五个基准的评估结果,覆盖 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六个前沿模型,并附带 HealthBench、Humanity's Last Exam、SWE-Bench Pro 等评测的设置与配置信息。
summary_zh: UK AISI 通过 EvalEval 的 Evaluation Cards 平台公开分享五个基准的评估结果,覆盖 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六个前沿模型,并附带 HealthBench、Humanity's Last Exam、SWE-Bench Pro 等评测的设置与配置信息。
Hugging Face 的 transformers 库新增 GGUF 模型支持,用户可通过熟悉的 API 在 Apple Silicon Mac 上运行 llama.cpp 量化 checkpoint。
推荐理由:transformers 新增 GGUF 支持,在 Apple Silicon 上通过熟悉 API 运行量化模型,性能接近 llama.cpp,为本地推理提供便捷入口。
NVIDIA TensorRT 11.0 新增多设备推理能力,单个 TensorRT 网络可通过 NCCL 分布式集合通信跨多 GPU 执行,同时保留 TensorRT 推理优化。该能力由 NVIDIA Dynamo-Triton 中的 TensorRT Multi-Device Integration 提供,用于应对生成式 AI 超出单 GPU 算力与内存限制的场景。
评估 AI 智能体的关键在于能否在真实环境中完成数十个连续工具调用并从失败步骤中恢复。仅判断模型输出是否合理无法验证任务是否真正完成,因此智能体评估已从单次函数调用评分演进为对整个任务完成度的评分。
TinyTorch 是哈佛与苏黎世联邦理工推出的开源课程,用纯 Python 和 PyTorch API 从零实现一个可运行的 ML 框架,共 20 个模块、4 个层级,笔记本电脑 4 GB 内存无 GPU 即可运行。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Amazon 与斯坦福大学联合发起 Stanford and Amazon Research Initiative,聚焦 AI、能源和医疗领域的前沿研究。目前 Amazon 在斯坦福资助超过 10 个团队的研究和博士奖学金,涵盖人形机器人、后量子密码学、因果测量科学和 AI 放射学等方向。合作通过联合研究项目、博士奖学金和研讨会等形式,缩短从突破性研究到实际应用的路径。
Kubernetes v1.37 将 PersistentVolumeClaimUnusedSinceTime 功能门控升至 Beta 并默认启用,PVC 保护控制器为每个 PVC 添加 Unused 条件,标识是否有运行中的 Pod 正在引用该卷。
NVIDIA推出DSX Ready认证计划,用于评定AI工厂电源与冷却产品是否符合DSX参考设计要求。计划初始覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类,Hitachi Energy、LG Energy Solution、Tesla及LG Electronics、LiquidStack、Vertiv等合作伙伴产品已获认证。该计划帮助建设者降低集成风险,但通过认证不替代现场工程评估。
Amazon Bio Discovery团队发表三篇论文,分别提出MochiBind结合力预测、CA-MAP可开发性预测和基于智能体的纳米抗体设计流程。MochiBind在跨抗原验证中比结构基线平均提升近10%配对准确率,并在CPU上约13秒完成20万对抗体评分。
推荐理由:三篇论文分别针对抗体设计中的结合力排序、可开发性预测和全流程设计验证,给出了可复现的评估框架与实验结果。
summary_zh: 分子动力学(MD)模拟让研究人员观察药物与靶点随时间的相互作用稳定性、蛋白质构象变化和分子系统演化,相比结构预测和分子对接仅提供快照,MD 能捕捉分子的持续运动。
NVIDIA 推出全栈安全系统 Halos,覆盖 AV 与机器人从硬件、软件、AI 行为到部署生命周期的安全工程。Halos 整合 DRIVE AGX Thor、IGX Thor、Halos OS、Alpamayo、Isaac Lab 与 Omniverse,并提供可追溯的安全证据与第三方认证支持。
NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,埃及 NVIDIA Deep Learning Institute 学员一年内增长逾十倍,Hassan Allam Utilities 与 A15 将投资约 4 亿美元建设新数据中心。非洲一年内已有四座 AI 工厂宣布或上线,另有 656 兆瓦新产能待落地。NVIDIA 在非洲已培训逾 8.5 万名开发者,原定三年 10 万名目标。
RetroChimera用学习排序融合R-SMILES 2与NeuralLoc的互补预测,改进小分子逆合成预测。10个高难度目标中,其完整路线被接受9条,de novo、editing与NeuralSym分别为5、4、2条。模型发表于Nature并开源实现与权重,能召回稀有反应,也能在专有数据集上零样本迁移和微调。
summary_zh: AI Now Institute 研究员 Aya Ibrahim 指出,AI 末日情景正主导政策辩论,但选举官员对 AI 预测的局限性可能缺乏审查。
summary_zh: NVIDIA Earth-2 帮助天气敏感行业把观测数据转化为及时决策。能源公司采集风能和太阳能资产数据,应急管理团队依赖雷达和本地传感器,卫星供应商持续观测地球。
summary_zh: NVIDIA 发布开源安全运行时 OpenShell,为 AI Agent 提供沙箱执行与策略管控,合作伙伴 Cisco DefenseClaw 和 JFrog 已在其基础上构建治理与技能扫描能力。
summary_zh: 2026年9月21日,匹兹堡举办全球大会,聚焦卡内基梅隆大学机器人研究所的领导力地位。文章由Mallory Lindahl撰写,发布于CMU Robotics Institute官网。
Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。
推荐理由:把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。
Cloudflare宣布Python Workers正式进入一般可用(GA)阶段,Python成为Cloudflare Developer Platform的一等语言。
推荐理由:Python开发者现在可以在Cloudflare Workers中原生运行Python应用与框架,并直接调用平台服务,无需编写JavaScript胶水代码。
OpenAI 与独立的数学与人工智能咨询委员会(Advisory Group on Mathematics and Artificial Intelligence)合作,指导新兴 AI 成果的评审与传播。该委员会将为 OpenAI 的 AI 研究结果发布提供外部建议与沟通指引。
Higgsfield AI 借助 GPT-6 Astra 一日内上线新视频功能,让小企业视频广告创作更便捷,并加速新创意工具推向市场。
NVIDIA 在纽约气候周重点介绍五家用 AI 推进清洁能源的公司,覆盖电网、核电、储能与聚变。ThinkLabs AI 基于 NVIDIA CUDA 的数字孪生与 agents 帮助 Southern California Edison 把电网互联评估从 30-45 天缩短到 2 分钟,Atomic Canyon 的 Neutron 和 NIVA 平台服务于核电运营。
summary_zh: OpenAI 提出面向下一阶段 AI 的共建标准框架,呼吁全球协调评估、报告与治理以提升安全性。 该框架强调标准化评估与治理机制,但未给出具体指标、版本或可用性细节。 OpenAI 提出面向下一阶段 AI 的共建标准框架,呼吁全球协调评估、报告与治理以提升安全性。 该框架强调标准化评估与治理机制,但未给出具体指标、版本或可用性细节。
summary_zh: OpenAI Academy 新增面向员工、开发者、领导者、教育工作者和学生的学习路径,帮助构建和展示实用的 AI 技能。 OpenAI Academy 新增面向员工、开发者、领导者、教育工作者和学生的学习路径,帮助构建和展示实用的 AI 技能。
TangleDiff 是一个深度学习框架,用于从头设计具有可编程特性的同源二聚体纠缠蛋白。其在 silico 成功率超过 70%,远高于当前模型约 1%。实验验证的 9 个同源二聚体中有 7 个成功形成水凝胶,且应力松弛动力学与指定的结合能相关。
Google 开发的 Co-Scientist 通过多个自主智能体搜索文献、生成并筛选假设,帮助生物化学家 Anna Pertl 找到针对 MYC 蛋白的新策略。Frontier AI 实验室与初创公司也在推出类似平台,强调人类提问与判断仍不可替代。
推荐理由:展示了多智能体协作在科学假设生成中的实际工作流,读者可迁移其‘提问—修正—验证’方法到自身研究场景。
Hugging Face 发布 tokenizers v1 预览版,在 Apple M4 Max 上单线程编码速度比 v0.23 快 3 到 30 倍,8 线程扩展效率达 76%。主要改进包括 bitcannon 位流分词、线程本地词缓存、无分配合并循环和批量模型调用,且输出 token ID 与 v0.23 完全一致。
推荐理由:原文给出了速度提升和开放入口,读者可以据此判断它会怎样改变现有工作流。
summary_zh: V7 使用 GPT-5.6 将分散的公司文件转化为上下文,供智能体完成复杂且带来源链接的工作。成本降低 78% 同时准确率提升。 V7 使用 GPT-5.6 将分散的公司文件转化为上下文,供智能体完成复杂且带来源链接的工作。成本降低 78% 同时准确率提升。
summary_zh: AI Now Institute 联合主任 Sarah Myers West 接受 Al Jazeera《The Listening Post》采访,指出每次科技行业出现实质性监管动向时,"末日竞赛"叙事就会卷土重来。
summary_zh: 研究提出 B-BiLO 框架,在 PDE 逆问题中结合贝叶斯推理与双层局部算子学习,上层用 Hamiltonian Monte Carlo 采样后验参数,下层通过低秩适配(LoRA)微调神经网络近似解算子。
summary_zh: AIPerf 是用于大规模 LLM 推理基准测试的工具,旨在解决单进程性能限制、Python GIL 并发瓶颈以及非标准化负载生成器测量不可靠的问题。
Hugging Face 遭黑客入侵,AI Now Institute 首席科学家 Heidy Khlaaf 指出,普通安全工程本可阻止攻击触及数据。代理运行在未设计用于 containment 的软件中,且无人监控出站流量。
Google Research 推出 MilleMiglia,一个 C++ 实例生成器,用于构建中段物流网络的真实基准。中段物流覆盖区域或大陆尺度的配送中心间运输,占物流成本大头且影响时效,但学术研究长期缺乏公开高质量数据。MilleMiglia 在 GitHub 开源,通过隐私保护的方式捕捉中段运输的多车辆接力、时间窗口与分拣同步等约束,为后续优化研究提供基础。
summary_zh: MIT Reads 迎来十周年,将重点转向虚构与回忆录阅读,强调故事帮助人们理解自身与世界观的作用。MIT 图书馆馆长 Chris Bourg 与校长 Sally Kornbluth 均表示,集体阅读与讨论在 AI 影响教育与校园社交的背景下更具现实意义。
Google AI & Economy 项目新增诺贝尔经济学奖得主 Philippe Aghion、多伦多大学教授 Ajay Agrawal 等顾问与访问学者。Anu Madgavkar 和 Daniel Rock 将共同领导该研究项目,聚焦全球 AI 扩散、小企业生态与生成式 AI 对劳动力市场的影响。团队将持续更新 ATLAS v1.0 数据并推动实证研究。
Google 工程师与设计师 Jane Wade、Sergio Hudson 合作,基于 Google Flow 打造 Styling Suite 与 Runway Visualization 两款工具。
OpenAI 发布澳大利亚青少年安全蓝图,这是一项包含六大支柱的路线图,旨在为年轻人提供更安全的 AI 体验并赋能青少年。
summary_zh: JST-ERATO 启动 SUZUKI Mathematical AI Informatics 项目,由东京大学信息科学与技术研究生院深度学习理论团队主任 Taiji Suzuki 担任研究总监。
PyTorch Day Japan 2026 将于 12 月 10 日在东京举办,由 PyTorch Foundation、Hugging Face、IBM 和三菱电机联合主办,聚焦 PyTorch 及 vLLM、DeepSpeed、Ray、Helion、Safetensors 等开源项目。
ReScale4DL 系统评估了图像分辨率对生物图像分割的影响,在分辨率降至原始 6%-25% 的下采样图像上训练 popular architectures,分割准确率最多提升 25% mean IoU 或仅下降不到 5%。下采样同等比例提升了信息吞吐并降低存储与推理时间,为高效、可持续、低成本的生物成像流程提供实用指导。