Latest selected 81–100 of 201 02:55 PyTorch Blog SelectedAI score 67 67 PyTorch Blog发布Low Precision Flash Attention 4,在Blackwell上扩展MXFP8前向与反向,前向达2.85 PF/s、反向达2 PF/s,LLM形状较BF16加速1.6×和1.52×。代码已开源至ads_model_kernel_library/lp_fa4。
Why it matters: 原文给出了MXFP8前向与反向的PFLOP/s数据及开源地址,读者可据此评估Blackwell训练栈的实际加速效果。
23:02 Lambda SelectedAI score 74 74 Lambda 在 MLPerf Inference v6.1 提交结果,首次在数据中心硬件上运行智能体推理基准,并部署超过万亿参数的 Kimi K2.6 模型。
Why it matters: Lambda在MLPerf Inference v6.1提交了首个数据中心硬件上的智能体基准和万亿参数模型部署,并给出与v6.0的同比性能提升数据。
19:09 Latent Space SelectedAI score 88 88 TypeSafe 发布 Jev,基于 RLCD 训练,宣称比小型前沿 LLM 快 20–200 倍、便宜 40–400 倍,输出 token 免费。社区指出它并非通用语言模型,更接近结构化分类器或裁判模型,适合替代生产系统中的 LLM 路由与判断。
Why it matters: 原文给出 Jev 在延迟与成本上的具体倍数优势,读者可据此判断其是否值得替代现有分类器与路由策略。
13:00 NVIDIA Blog SelectedAI score 62 62 曼彻斯特大学与 NVIDIA Earth-2 团队基于 Isambard-AI 训练 Earth-2 CorrDiff 和 StormCast,生成了分辨率 2-3 平方公里的英国全域污染模型,训练仅用两天。同一工作流可在 DGX Spark 桌面系统运行推理,作者计划开源训练数据与工作流,并展望由智能体接口驱动的实时污染问答。
Why it matters: 展示了生成式AI模型从国家级超算到桌面设备的可迁移路径,降低了污染建模的硬件门槛。
08:00 Apple Machine Learning Research SelectedAI score 73 73 Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。
Why it matters: 选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。
00:55 NVIDIA Blog SelectedAI score 65 65 NVIDIA 在 AI Infra Summit 公布 Vera Rubin NVL72 与 DSX 平台新成果,MLPerf Inference v6.1 中 Vera Rubin NVL72 较 GB300 NVL72 吞吐量提升最高 3.7 倍,DSX MaxLPS 在相同功耗下集群 token 吞吐量提升 24%、每瓦性能提升 23%。
Why it matters: AI基础设施的关键指标正从峰值性能转向每兆瓦智能体token数,读者可据此评估自身AI工厂的能效与扩容空间。
21:00 Cloudflare · AI SelectedAI score 79 79 Cloudflare 发布新的 Disallow AI Training 设置,允许网站在保持搜索可发现性的同时拒绝混合型爬虫进行 AI 训练。Apple、Google 和 Microsoft 已承诺遵守该设置。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
12:53 LangChain · Official SelectedAI score 70 70 LangChain 博客汇总了 Schneider Electric、Vodafone 和 monday.com 在生产环境中规模化智能体的做法。
Why it matters: 三家公司从平台化、观测和架构边界三个角度展示了规模化智能体的实际路径,适合参考其基础设施层建设思路。
12:00 MIT News · AI SelectedAI score 62 62 MIT研究人员提出HardFlow算法,通过在生成过程末端而非中间步骤强制硬约束,使扩散模型和流匹配模型在机器人路径规划等安全关键场景中既满足严格约束又提升解质量。实验表明HardFlow在机器人操作、迷宫导航和文本引导图像编辑中实现完美约束满足,并在解质量上持续超越基线,计算时间与多数方法相当或更低。
Why it matters: 该方法在部署时即可对预训练生成模型施加硬约束而不重新训练,为机器人等安全关键场景提供了可即插即用的改进路径。
09:53 LangChain · Official SelectedAI score 60 60 LangChain 推出 Connections 功能,为 Managed Deep Agents 提供命名凭证与按调用者解析的身份机制。凭证分为 agent 拥有和用户拥有两种,类型分别为静态密钥与 OAuth 授权,通过 connections.get() 在运行时按 slug 读取。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
01:45 PyTorch Blog SelectedAI score 64 64 Hugging Face Kernels 项目正式支持 Helion,开发者可通过 kernel-builder 打包和发布 Helion 内核,用户用 get_kernel 一键加载。Helion 以
Why it matters: Helion 与 Kernels 项目整合后,开发者可一键发布可调优内核,用户免依赖地狱即可加载预调优配置。
08:00 Together AI SelectedAI score 69 69 Together AI 升级微调平台,新增 GLM-5.3、Kimi K2.7、DeepSeek-V4-Flash、Qwen 3.8-27B、Gemma 4 等开源模型支持,并引入实验实时追踪、Expert LoRA、早停、任意批量大小、样本权重、预飞行校验与打包控制等功能。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
02:30 Kubernetes AI SelectedAI score 62 62 Kubernetes v1.37 引入 InPlacePodVerticalScalingSchedulerPreemption 特性门控,允许调度器为原地扩容被 deferred 的 Pod 主动抢占同节点低优先级工作负载。原文给出从创建 kind 集群、配置 PriorityClass、触发扩容到观察 Preempted 事件的完整演示步骤。
Why it matters: 原文给出了调度器主动抢占低优先级工作负载的机制,读者可以据此评估集群密度与关键服务响应性的平衡。
08:01 PyTorch Blog SelectedAI score 62 62 PyTorch Foundation 于 9 月 8–9 日在上海举办 PyTorch Conference China 2026,与 KubeCon + CloudNativeCon 和 OpenInfra Summit 同期举行。
Why it matters: PyTorch Foundation 在中国大会公布新成员与开放 AI 栈分层,读者可据此追踪开源生态的协作版图和硬件集成进展。
08:00 Together AI SelectedAI score 60 60 Together AI 内核团队在 Vera Rubin NVL72 上扩展 ThunderKittens,支持 NVFP4 与 FP8 GEMM,并通过双 K 步长、独占张量内存、更大共享内存、B 侧收集器与 Early A release 等优化,将 NVFP4 推至超 22 PFLOPS,与 cuBLAS 和 CuTE DSL 竞争。
Why it matters: 原文给出了在 Vera Rubin 上优化 NVFP4/FP8 GEMM 的具体方法与性能数据,读者可迁移这些调优思路到自家 Rubin 部署。
08:00 Hugging Face Blog SelectedAI score 67 67 Hugging Face 用 Gradio Workflow 重建了 AUTOMATIC1111 的核心功能,形成包含 11 条媒体管道、73 个节点的单一工作流画布,涵盖文生图、高分辨率修复、图生图、提示词矩阵、VLM 问答、检测到 inpaint 掩码、ControlNet 风格标注器、背景去除、PNG Info 读取和图生视频。
Why it matters: 原文展示了用同一套画布串联多种模型与媒体管道的构建方式,读者可据此评估 gr.Workflow 在多模态工作流中的可复用性。
08:00 Together AI SelectedAI score 69 69 Together AI 公开预览抢占式计算节点,算力与标准节点相同,按 sub-hourly 计费为按需价的 50%。回收时有 5 分钟 drain 窗口,节点标注 together.ai/compute-class=preemptible,适合可 checkpoint 或重试的短实验、推理突发和批处理任务。
Why it matters: 原文给出了成本变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
08:00 Hugging Face Blog SelectedAI score 63 63 TRL v1.14 的 AsyncGRPOTrainer 新增 LoRA 适配器仅同步功能,结合 HF Jobs Storage Bucket 挂载,使训练与推理可运行在独立机器上,无需 NCCL。五次实验将 500 步训练从 3h27m 优化至 53min,通过 token 预算批处理和提升并发请求数将瓶颈从训练端转移到生成端。
Why it matters: 通过LoRA适配器仅同步加存储桶挂载,训练与推理可部署在独立HF Jobs上无需NCCL,五次实验将500步训练从3小时27分压缩至53分钟。
08:00 Together AI SelectedAI score 64 64 Together AI 发布开源 AI 栈指南,将栈分为模型、推理、网关与路由器、Harness、工具与上下文管理五层。推荐同时使用大模型(如 Kimi K3,1.8T 总参数)与小模型(如 GLM 5.3 Flash,320B 总参数)处理不同复杂度的任务,并可通过 OpenRouter、Vercel AI Gateway 或 LiteLLM 路由多提供商。
Why it matters: 原文分层拆解开源 AI 栈各层组件与选型思路,开发者可按需组合模型、网关与工具。
03:03 Lambda SelectedAI score 60 60 SPREEAI 将虚拟试穿从四模块串联架构整合为单一统一扩散模型,在 NVIDIA H100 上完成 50,000 步扩散训练,并通过 FP8 量化与 cuDNN 注意力内核将单请求推理延迟降至 1.7 倍、峰值显存减半。
Why it matters: 原文给出了从模块化架构转向统一扩散模型的具体做法,以及推理优化的实测数据,读者可据此理解虚拟试穿模型的训练流水线与基础设施选型逻辑。
Previous 1 … 3 4 5 6 7 … 11 Next