MIT 开发的医学数据库如何演变为全球数据共享标准
MIT 和 Beth Israel Hospital 于 1975 年开始收集和数字化心电图记录,1980 年制成磁带并通过邮寄分发,最终成为 PhysioNet 首个数据库。
MIT 和 Beth Israel Hospital 于 1975 年开始收集和数字化心电图记录,1980 年制成磁带并通过邮寄分发,最终成为 PhysioNet 首个数据库。
Berkeley Sky Lab 与 IBM Research 将 K-Search 进化式内核搜索框架扩展至 MLX 后端,通过结构化 CUDA-to-MLX 翻译层在 Apple Silicon 上复现专家级性能。在注意力内核上达到原生 MLX 的 0.97 倍速度,Mamba SSM prefill 相比社区 mlx-lm 提升约 20 倍;代码与后端已开源。
推荐理由:结构化翻译层让 CUDA 经验可迁移到 Apple Silicon,读者可借此评估跨平台内核优化的可行边界。
ThunderAgent 在单 8×H100 节点上相对 SGLang 达到 2.5 倍吞吐量、P50 延迟降低约 10 倍,8 节点集群实现 2.4 倍加速且接近线性扩展。
推荐理由:把多轮 agent 请求视为程序而非独立请求,让 KV cache 命中率提升并缓解多节点负载不均。
Together AI 与 Moonshot AI 达成战略合作,成为 Kimi 模型的首发平台,首发模型为 Kimi K3。Kimi K3 是迄今最大开源模型,参数规模达 2.8T 的稀疏 MoE 架构,支持原生视觉与 1M token 上下文窗口。
Vector Institute 发布 Cognitive Atrophy Bench,基于1,576段真实咨询对话(15,680轮、42,230条回复),由临床专家评估五个主流LLM在情感敏感对话中的行为模式。研究发现模型在长期对话中会变得更主导、更少开放式提问,逐渐将应对与决策转向模型端。
推荐理由:该基准为评估AI在情感对话中是否削弱用户自主性提供了可复现的测量框架。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
NVIDIA 发布 Cosmos-H-Dreams,一款基于单张 RTX PRO 6000 GPU 运行的手术机器人实时生成式仿真器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,通过 FlashDreams 推理库实现约 160 fps 的交互式操作,每潜在帧仅需 2 步去噪,支持 dVRK 桌面缝合任务,并可连接学习型手术策略形成闭环。
推荐理由:NVIDIA将手术世界模型压缩至单卡实时推理,使外科机器人策略的闭环评估与合成数据生成不再依赖稀缺物理硬件。
Hugging Face 发布技术复盘,详细记录了 2026 年 7 月一次持续约 4.5 天的自主 AI 代理入侵事件。
推荐理由:原文披露了自主AI代理利用多阶段注入横向渗透的完整技术链路,为防御方提供了可迁移的检测与响应方法。
Berkeley AI Research 提出 ABBEL 框架,将交互历史压缩为自然语言信念状态,并通过信念评分监督信念内容。在 CollabBench 协作编程中,ABBEL 恢复约一半全上下文性能差距,峰值上下文 token 数降至约 4.2 万,训练步数减半;在 Combination Lock 游戏中,结合领域知识的信念评分可接近或超越全上下文模型。
推荐理由:通过将摘要隔离为可监督的信念状态,在协作编程和组合游戏中以更少训练步数和更低显存缩小了与全上下文模型的性能差距。
Amazon 向 Lean Focused Research Organization(FRO)提供长期大额资金支持,这是 FRO 历史上最大单笔捐赠。
美国能源部在 Genesis Summit 上宣布首批资助项目,MIT 主导 6 个、参与 9 个,涉及量子传感器、稀土提取、聚变数字孪生、AI 驱动材料设计等方向。Phase I 阶段团队需展示 AI 与科学工作流整合,并评估科学价值;后续可申请进一步资助。研究经费待签订协议协议。
Nunchaku Lite 现已原生集成到 Diffusers,用户可通过 from_pretrained() 直接加载 4-bit 量化扩散模型,无需单独推理引擎或本地 CUDA 编译。
推荐理由:Nunchaku Lite 现已原生接入 Diffusers,无需额外引擎即可通过 from_pretrained() 加载 4-bit 量化模型,在 RTX 5090 上 VRAM 从 24GB 降至约 12GB,推理加速约 30%。
Together AI 发布 Dedicated Model Inference 平台,支持部署自有或开源权重模型,并提供部署配置、预热加速、Canary/蓝绿/滚动发布、A/B 与影子流量测试及 Prometheus 可观测性。平台覆盖从实验到生产的全生命周期,并同步开启自定义训练(含 LoRA 与强化学习)封闭测试。
推荐理由:原文给出部署预热、流量切换与可观测性等具体能力,读者可以据此判断它能否降低自研推理栈的运维成本。
MoE 模型通过路由器为每个 token 动态选择少量专家子网络激活,在增加总参数的同时保持每 token 计算稀疏。文章首先解释路由决策、负载均衡与训练中 specialization 的形成机制,随后报告了在 4 张 A100 GPU 上微调 350 亿参数多模态 MoE 的经验,涵盖 5 种失败的 sharding 方案、最终成功的方法,以及按层路由审计揭示的音频、视频与文本容量分配。
Google Research发布SymptomAI研究,基于Gemini Flash 2.0通过13,917人随机实验表明临床医生在超50%情况下更偏好其鉴别诊断,且主动询问策略显著优于被动回答。
推荐理由:该研究通过一万三千余人的随机对照实验,为对话式AI症状评估提供了与临床医生横向比较的基准数据,并揭示了主动询问策略对诊断准确性的提升作用。
Google Research在Nature发表强化学习框架,使量子计算机能在运行中持续自我校准。在Willow处理器上,该方法将逻辑稳定性提升3.5倍,逻辑错误率在专家校准后再降20%,表面码和颜色码分别达到千次和百次纠错周期内少于一次逻辑错误的纪录水平。数值模拟表明所需RL训练迭代次数与系统规模无关。
推荐理由:Google Research在Nature发表强化学习框架,使量子计算机能在运行中持续自我校准,将逻辑错误率降至纪录低点。
summary_zh: Dimitri Bertsekas 博士毕业于 MIT,曾任 MIT EECS 荣誉教授、LIDS 研究员及亚利桑那州立大学计算决策教授,于 6 月 3 日在马萨诸塞州贝尔蒙特家中去世,享年 83 岁。
Google DeepMind 在 DOE 的 Genesis Mission Summit 2026 上宣布投入 4000 万美元的 AI token 与云额度,支持 Genesis Mission 的科研人员。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:新模型在 token 效率和成本上较 3.5 Flash 显著提升,3.5 Flash-Lite 以更高吞吐和更低延迟面向规模化 agentic 工作流。
Grabette 是 Pollen Robotics 发布的开源手持采集设备,配合 Gripette 机械爪端,能用普通相机、IMU 和深度相机记录操作演示,并自动生成 LeRobot 格式的机器人就绪数据集。
推荐理由:原文给出了低成本的采集方案与开放数据集入口,读者可以据此判断它能否降低机器人学习的数据门槛。
Together AI 与 Y Combinator 合作推出首个 YC 专属 GPU 集群,为 YC 旗下 AI 原生初创公司提供按需 GPU 资源。创业公司可通过 Together 自助门户直接预订、配置和管理 GPU,享受长期价格而无需长期承诺,集群当前已满载运行。该集群覆盖从单节点到大规模扩展的需求,创始人还可获得 Together 团队在推理与训练方面的最佳实践支持。
Bailey Flanigan 从威斯康星州农田起步,在医学、公共卫生、经济学与计算机科学之间辗转,最终成为 MIT Schwarzman 学院与政治学系及 EECS 的联合教员、LIDS 首席研究员。她开发随机选择公民大会参与者的算法,在 AI 议题假设示例中平衡代表性、防操纵与透明度,推动有意义的民主参与。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
DharmaOCR 通过领域专精与两阶段训练(监督微调 + DPO),在巴西葡萄牙语基准上得分 0.925,显著高于 Mistral OCR4 的 0.798 与 Unlimited-OCR 的 0.7587。监督微调将参数集中于巴西葡萄牙语的词汇、句法与文档结构,DPO 阶段则降低推理时的退化率与不稳定输出。两阶段缺一不可:微调建立领域能力,DPO 确保该能力在生产条件下稳定。
Google DeepMind 与 Isomorphic Labs 发布 bioresilience 联合方案,通过预防、检测、响应三方面应对生物安全威胁。AlphaFold 映射近所有已知蛋白质三维结构,AlphaGenome 揭示基因组功能,IsoDDE 提供药物设计真实精度。AlphaEvolve 优化宏基因组测序算法以更快检测新疫情,SynthID 水印技术正适配生物序列筛查。
MIT与Red Hat、IBM合作提出GIFT(Geometric Inference Feedback Tuning)框架,通过推理时扩展利用视觉语言模型自身的近似正确答案生成训练数据,自动修正模型在图像转CAD代码任务中的错误。实验表明,GIFT仅用约20%的计算量即可生成更准确的CAD程序,且生成的3D模型几何形状与真实模型更吻合。
推荐理由:该方法利用模型自身错误生成训练数据,以更低计算成本提升图像转CAD代码的准确性。
summary_zh: Together AI 解释推理服务可靠性的分层含义:99% 需快速检测并调度故障节点,99.9% 要求双设施持续部署与权重冗余,99.99% 需预留跨区域容量以应对整区宕机。
Hugging Face 检测到生产基础设施遭自主 AI 代理系统入侵,未经授权访问了部分内部数据集和凭证,未发现公开模型、数据集或 Spaces 被篡改。攻击通过恶意数据集利用数据处理管道中的代码执行路径发起,代理框架在数千个短期沙箱中执行了超过 17,000 条操作。
推荐理由:Hugging Face 披露了由自主 AI 代理系统驱动的入侵事件,并分享了用自有开源模型进行取证分析的实践经验。
IBM Research 在 Hugging Face 博客指出,将路由引入 Agent 系统时,模型选择会迅速演变为系统优化问题。实际成本受缓存、基础设施和负载模式影响,GPT-4.1 在标价更低的情况下反而比 Claude Sonnet 4.6 更贵;路由需同时平衡成本、质量、延迟、合规与可靠性。
推荐理由:从成本与系统优化角度重新审视路由设计,为构建 Agent 系统提供可迁移的权衡思路。
Meta 提出分层兴趣表征(Hierarchical Interest Representation),作为广告系统的上游表征层,基于数十亿交互数据端到端训练。
Hugging Face 发布 Real World VoiceEQ 基准,从声学信息层面评估语音交互的人本质量,覆盖ASR、TTS、S2S与语音理解,超40款开源与闭源模型参与。评测基于超过100万条人类评分,包含78.5万条TTS与4.8万条STS评分,并指出传统基准在噪声、口音、情绪等真实场景下高估模型表现,语音模型在
推荐理由:原文呈现了覆盖40余款模型的评测结果与关键发现,帮助读者在语音接口成为主流交互方式的背景下重新审视现有基准的局限。
Together GPU Clusters 推出被动健康检查、自动节点修复、Slinky 1.0 等功能,覆盖 GPU 总线故障、热节流、Xid 错误等场景。配合集群详情页、外部 OIDC、启动脚本和验收测试选项,提升多团队场景下的可观测性、访问控制与自定义能力。
推荐理由:原文给出了平台健康与运维控制两方面的具体能力变化,读者可以据此评估它对现有训练与推理工作流的影响。
Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。
推荐理由:原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。
Inkling 由 Thinking Machines 发布,是一个原生接收图像、文本和音频输入的大规模多模态开源模型,总参数约 1T、活跃参数 41B,支持 1M 上下文窗口。
推荐理由:Inkling 是原生接收图音文三模态的大规模开源模型,提供 BF16 与 NVFP4 双版本及 day-0 支持的推理引擎,读者可据此评估其在多模态推理基准中的相对位置。
summary_zh: Ikigai 基于表格与时间序列数据构建基础模型,可持续接入企业多源数据,通过预测真实结果进行自我学习。该模型将企业流程数字化,提供大规模实时规划与模拟不同选项的能力。
summary_zh: MIT 开设 JARVIS Challenge,要求本科生在四周内用 AI 设计、加工、组装并测试一台 50–100 磅推力的单转子喷气发动机。
summary_zh: MIT 城市研究与规划系于 2019 年推出网络安全诊所课程(Cybersecurity Clinic),由 Jungwoo Chun 与 Lawrence Susskind 授课。
Google 在印度启动 ATL Saathi 试点,这款由 Gemini 驱动的 web 应用为 Tinkering Lab 教育者提供 24/7 规划与培训助手。
MIT EECS副教授Ashia Wilson与研究生Vinith Suriyakumar联合MIT Healthy ML Lab、Thorn及波士顿大学研究者,开发了一种基于高斯探测的审计方法,通过分析LoRA适配器在模型内部结构中的修改来判断模型是否被专门化用于生成儿童性虐待材料(CSAM),而无需生成任何输出。
推荐理由:该方法不生成内容即可检测模型是否被适配为产生CSAM,为平台审核开源模型提供了可扩展的新技术路径。
Amazon与密歇根大学提出HydroShear,基于水弹性接触模型并加入路径相关力追踪,准确模拟触觉剪切力。机器人仅在仿真中训练强化学习策略后直接部署到真实Franka机器人,在四项接触密集任务上平均成功率93%,远超TacSL的34%和FOTS的58-61%。
推荐理由:它用仿真解决了触觉力建模的难题,让机器人在模拟中训练后直接迁移到真实世界。