Agent-Callable Feature Coverage:衡量软件对 AI Agent 的就绪程度
研究提出 Agent-Callable Feature Coverage(ACFC)指标与 Agent Readiness Conformance(ARC)框架,从可访问性、可发现性、可控性三轴评分(0-9)。
研究提出 Agent-Callable Feature Coverage(ACFC)指标与 Agent Readiness Conformance(ARC)框架,从可访问性、可发现性、可控性三轴评分(0-9)。
DASA 使用冻结参考模型的激活梯度反馈引导连续合成输入嵌入优化,直接用于下游微调而无需离散 token 投影。在 Llama 与 Qwen 家族 1B–32B 模型、6 个基准上,DASA 达到与自然文本数据相当或更优的性能,多数对比超越 GRADMM,并实现 3.6–4.9 倍加速、峰值 GPU 内存相当。
summary_zh: Qiskit 量子编译器提出一种防泄漏、成本感知的回归测试选择方法,预注册预算绑定评估避免数据泄漏。
OpenAI在DevDay 2026一口气公布25项更新,重点包括常驻型Agent Dots、GPT-6.1 Sol模型、Codex云端升级、Agents API开放以及两项商业化动作。
推荐理由:OpenAI把Agent从单次任务延展到长期常驻运行,并用新模型与API把成本与执行环境配套打开,读者可以据此判断其Agent产品线的整体推进方向。
OpenAI 在 Dev Day 推出 ChatGPT 应用发现与分发体系,聊天中自动推荐应用并支持在 ChatGPT 内直接使用,同时引入
推荐理由:OpenAI 把 ChatGPT 变成应用发现与分发入口,开发者可在聊天界面构建交互面板,用户身份与 AI 额度可带入第三方应用。
summary_zh: NVIDIA TensorRT Model Connect 是一个基于 TensorRT 的 C++ AI 模型参考实现开源项目。项目采用并行开发、模型族隔离、可逆变更和 GPU 验证等方式,围绕编程智能体进行设计,旨在让 NVIDIA 推理栈的性能更易被访问。
OpenAI 在 DevDay 推出 ChatGPT 重大更新,包括开放插件系统、共享工作空间 Space、协作文档 Pages 与 Slides、Slack 和 Teams 集成、Meetings 插件、MCP Events 与 Team Tasks 自动化的新定价方案 Pro 500,以及面向企业客户的 OpenAI Marketplace。
推荐理由:开放插件系统与共享工作空间让 ChatGPT 向平台型工具演进,读者可据此评估它对现有协作工具的替代压力。
NVIDIA发布开源表格预测基础模型Kumo Tabular,单次前向传播即可预测,无需训练或调优。在TabArena等四个基准上排名第一,28M至215M参数规模下准确-效率达前沿,比LimiX-2快17倍。模型基于Transformer仅在人工数据上预训练,以OpenMDW-1.1许可证商业可用。
推荐理由:表格预测长期依赖梯度提升树,Kumo Tabular以单次前向传播提供无需训练与调优的预测且在TabArena等基准排名第一。
summary_zh: ModelScope 托管超 17 万模型、2.5 亿用户,MoArk 托管约 2 万模型,两者均提供模型测试与定制服务,但规模仍远低于 Hugging Face 的 300 万模型。
Ollama 0.35 推出 /v1/systemone 端点,支持 Jev 风格的决策模型,本地运行无额外成本且延迟更低。今日上线三个模型:nimble(9B,Bespoke Labs)、tev1(4B,Together AI)和 tev1:0.8b(0.8B,Together AI)。
推荐理由:本地低延迟决策模型开放调用,对实时分拣、路由与审核场景有直接迁移价值。
AI推理基础设施公司Modal Labs正由Accel领投完成约7.5亿美元融资,估值157.5亿美元,四个月内较上一轮估值翻三倍多。新一轮规模此前未公开,Axios与Bloomberg已报道部分细节。融资背景是推理服务需求飙升,尤其是开源模型用户;Fireworks年化收入已突破10亿美元,多家推理初创预计年底达同一里程碑,但算力成本高昂导致毛利微薄。
summary_zh: Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日成立,为微软在东南亚首个研究实验室。
Hcompany 发布智能体模型 Holo4,提供 27B 稠密版与 35B-A3B MoE,并推出 Holotron4 Nano。
推荐理由:同一模型同时覆盖图形界面、代码和工具调用,便于对照它在更低成本下与闭源模型的长流程得分差距。
Simon Willison 用闭幕演讲笔记按时间串起 2026 年迄今的 LLM 变化,指出 Claude Opus 4.5 和 GPT-5.1 配上各自编码智能体后已足以日常使用。
费米宇宙发布全球首个全链路量子增强大模型FermiQLLM 1.0,基于Qwen开源基座模型,在数据表征、模型结构、训练、强化和评测五个环节完成系统性量子增强,兼容现有GPU算力。
OpenRouter 联合创始人 Alex Atallah 与 AMP 合伙人 Anjney Midha 在 Latent Space 播客中回顾了 OpenRouter 从早期开放模型生态成长为日均 10 万亿 token 路由层的历程。讨论涵盖多模型赌注、模型实验室在分发上的困境、VC 曾将其视为
Latent Space 汇总了 9/23–9/24 的 AI 新闻与社区讨论:Claude Opus 5.5 在 SimpleBench 达 88.4%,GPT-6 Astra/Sol/Luna。
summary_zh: commit-rewrite 0.2 发布,这是一个用于重写 git commit 消息的 AI 工具。 该工具基于 LLM 开发,可自动优化提交说明的表述与格式。
WhisperX 扩展 OpenAI Whisper,加入逐词时间戳、说话人标注和批量推理,将原始音频转为结构化转录文本。AWS WhisperX Deep Learning Container 打包所有依赖,部署到 SageMaker 实时或异步端点,无需自定义镜像。
summary_zh: Amazon Bedrock AgentCore Gateway 与 Model Context Protocol(MCP)结合,让 AI Agent 在不复制或集中数据的前提下跨多个 AWS 账户查询。
PyTorch Foundation OSPO 与学术推广工作组在 PyTorchCon NA 2026 Day 0 举办学术工作坊,邀请使用 PyTorch、DeepSpeed、Helion、Ray、Safetensors、vLLM 的学术开源项目提交。
NVIDIA 博客介绍了如何将 MuJoCo 场景迁移到 MJWarp 以实现 GPU 加速。文章展示了从 SO-101 机械臂的 CPU 模拟到 2048 并行 GPU 环境的迁移步骤,包括模型上传、批处理状态复制、CUDA 图捕获和吞吐量测量。迁移后可实现单步从 CPU 世界到 GPU 批处理的并行推进。
推荐理由:NVIDIA 提供了从 MuJoCo 到 MJWarp 的迁移指南,展示了如何将单个机器人模拟扩展到 2048 个并行 GPU 环境,实现大规模采样。读者可据此在物理 AI 学习工作流中利用 GPU 加速。
HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。
推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。
AWS 博客教程演示将 OpenCode 与 Amazon Bedrock 上的开源权重模型(Kimi K3、GPT-OSS 120B、Nemotron 3 Super 120B)配对,实现终端本地交互、推理在 AWS 账户内完成、无基础设施管理和按量付费。
summary_zh: OpenAI Academy 成立两周年,OpenAI 宣布将 AI 技能带给更多社区。 OpenAI Academy 成立两周年,OpenAI 宣布将 AI 技能带给更多社区。
David Siegel SM ’86、PhD ’91 将在 2026-27 学年担任 MIT Innovation Fellow,与 MIT Schwarzman College of Computing 合作探索 AI 加速科学发现。
NVIDIA AI Day Singapore 展示 Nemotron 3 Super、Nemotron 3 Nano Omni、Cosmos 开放世界模型及 VSS 蓝图在东南亚的落地。
summary_zh: Simon Willison 发布 llm 0.36 版本更新。OpenAI 相关内容在 9 月 22 日的月度简报中被提及,涵盖 LLM 领域重要进展。
vLLM 推出硬件无关(HW agnostic)层,确保项目在推进前沿 GPU 性能工程的同时,继续支持旧 GPU、消费者级 GPU 和树外加速器。新层保持 fullgraph torch.compile 兼容、可扩展、与硬件特定路径隔离,并使用原生 PyTorch 或可移植 DSL 实现。
推荐理由:vLLM 新增硬件无关层,让关心多硬件和旧 GPU 的用户在不牺牲可移植性的前提下继续使用。
NVIDIA Isaac ROS 5.0在多伦多ROSCon发布,引入智能体工作流与GPU加速软件包,帮助人与AI智能体共同开发机器人。FoundationPose提供面向智能体的推理库,使机器人感知并跟踪物体位姿的速度最高可快5.5倍。新版支持ROS Lyrical和Ubuntu 24.04。
Microsoft Agent Framework 发布 Foundry 托管代理隔离,包含用户隔离和 Foundry 托管会话隔离两个独立控制,分别对应调用者身份和沙箱会话。开发者可使用 .NET 和 Python SDK 通过 AgentSession 传入 delegated user identity 或显式 agent_session_id,实现共享沙箱或独立会话等部署模式。
推荐理由:原文给出了用户隔离与会话隔离两套控制及多种可用模式,读者可据此评估自身应用在数据归属和会话生命周期上的选择。
oMLX 创造者兼维护者 Jun Kim 加入 Hugging Face,继续主导这一基于 Apple MLX 的本地 AI 项目。oMLX 保持 Apache 2.0 开源,从副业转为有资金支持的全职项目,并作为 mlx-lm、mlx-vlm 之上的新想法试验场。Hugging Face 还希望打通 transformers 模型定义到 MLX 参考实现的快速转换。
summary_zh: UK AISI 通过 EvalEval 的 Evaluation Cards 平台公开分享五个基准的评估结果,覆盖 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六个前沿模型,并附带 HealthBench、Humanity's Last Exam、SWE-Bench Pro 等评测的设置与配置信息。
Hugging Face 的 transformers 库新增 GGUF 模型支持,用户可通过熟悉的 API 在 Apple Silicon Mac 上运行 llama.cpp 量化 checkpoint。
推荐理由:transformers 新增 GGUF 支持,在 Apple Silicon 上通过熟悉 API 运行量化模型,性能接近 llama.cpp,为本地推理提供便捷入口。
RetroChimera用学习排序融合R-SMILES 2与NeuralLoc的互补预测,改进小分子逆合成预测。10个高难度目标中,其完整路线被接受9条,de novo、editing与NeuralSym分别为5、4、2条。模型发表于Nature并开源实现与权重,能召回稀有反应,也能在专有数据集上零样本迁移和微调。
Nathan Lambert 分析了 2026 年开放权重模型的竞争格局,指出中国模型在 Hugging Face 下载量、OpenRouter 使用占比及学术论文引用上均已领先美国。
summary_zh: OpenAI Academy 新增面向员工、开发者、领导者、教育工作者和学生的学习路径,帮助构建和展示实用的 AI 技能。 OpenAI Academy 新增面向员工、开发者、领导者、教育工作者和学生的学习路径,帮助构建和展示实用的 AI 技能。
Hugging Face 发布 tokenizers v1 预览版,在 Apple M4 Max 上单线程编码速度比 v0.23 快 3 到 30 倍,8 线程扩展效率达 76%。主要改进包括 bitcannon 位流分词、线程本地词缓存、无分配合并循环和批量模型调用,且输出 token ID 与 v0.23 完全一致。
推荐理由:原文给出了速度提升和开放入口,读者可以据此判断它会怎样改变现有工作流。
Jev 发布两天内获得 3600 万次视频观看,涌现 ModernBert、DiffusionGemmaJev、Bespoke Nimble、SemIf、Jevlike、Kev-0.5B 等复现;Bespoke Nimble 在评测中将 Qwen3.5 基线从 66% 提升至 90%,Kev-0.5B 可在 MacBook Pro 运行。数据被承认 100% 合成,且尚无该类模型的标准基准。
推荐理由:原文梳理了 Jev 类判别式决策模型的复现生态与浏览器自动化集成路径,读者可借此判断工作流控制平面的近期走向。
GPT-6 Astra 与 Fable 5.1 已具备变革性能力,可可靠完成数周的人类工作,如将 Zork 文本冒险游戏转为 3D 动作游戏、从视频重建 Umberto Eco 图书馆的 3D 场景。