SymptomAI:迈向日常症状评估的对话式AI代理
Google Research发布SymptomAI研究,基于Gemini Flash 2.0通过13,917人随机实验表明临床医生在超50%情况下更偏好其鉴别诊断,且主动询问策略显著优于被动回答。
推荐理由:该研究通过一万三千余人的随机对照实验,为对话式AI症状评估提供了与临床医生横向比较的基准数据,并揭示了主动询问策略对诊断准确性的提升作用。
Google Research发布SymptomAI研究,基于Gemini Flash 2.0通过13,917人随机实验表明临床医生在超50%情况下更偏好其鉴别诊断,且主动询问策略显著优于被动回答。
推荐理由:该研究通过一万三千余人的随机对照实验,为对话式AI症状评估提供了与临床医生横向比较的基准数据,并揭示了主动询问策略对诊断准确性的提升作用。
Google Research在Nature发表强化学习框架,使量子计算机能在运行中持续自我校准。在Willow处理器上,该方法将逻辑稳定性提升3.5倍,逻辑错误率在专家校准后再降20%,表面码和颜色码分别达到千次和百次纠错周期内少于一次逻辑错误的纪录水平。数值模拟表明所需RL训练迭代次数与系统规模无关。
推荐理由:Google Research在Nature发表强化学习框架,使量子计算机能在运行中持续自我校准,将逻辑错误率降至纪录低点。
summary_zh: Dimitri Bertsekas 博士毕业于 MIT,曾任 MIT EECS 荣誉教授、LIDS 研究员及亚利桑那州立大学计算决策教授,于 6 月 3 日在马萨诸塞州贝尔蒙特家中去世,享年 83 岁。
Google DeepMind 在 DOE 的 Genesis Mission Summit 2026 上宣布投入 4000 万美元的 AI token 与云额度,支持 Genesis Mission 的科研人员。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:新模型在 token 效率和成本上较 3.5 Flash 显著提升,3.5 Flash-Lite 以更高吞吐和更低延迟面向规模化 agentic 工作流。
Weaviate 在 v1.36.9 引入 query profiling,v1.38 正式可用,用户可通过 per-query flag 在单次查询中返回跨节点、跨分片的耗时明细。
推荐理由:原文给出了查询性能分析的细粒度能力与开启方式,读者可以据此定位慢查询的具体阶段。
Grabette 是 Pollen Robotics 发布的开源手持采集设备,配合 Gripette 机械爪端,能用普通相机、IMU 和深度相机记录操作演示,并自动生成 LeRobot 格式的机器人就绪数据集。
推荐理由:原文给出了低成本的采集方案与开放数据集入口,读者可以据此判断它能否降低机器人学习的数据门槛。
Together AI 与 Y Combinator 合作推出首个 YC 专属 GPU 集群,为 YC 旗下 AI 原生初创公司提供按需 GPU 资源。创业公司可通过 Together 自助门户直接预订、配置和管理 GPU,享受长期价格而无需长期承诺,集群当前已满载运行。该集群覆盖从单节点到大规模扩展的需求,创始人还可获得 Together 团队在推理与训练方面的最佳实践支持。
Bailey Flanigan 从威斯康星州农田起步,在医学、公共卫生、经济学与计算机科学之间辗转,最终成为 MIT Schwarzman 学院与政治学系及 EECS 的联合教员、LIDS 首席研究员。她开发随机选择公民大会参与者的算法,在 AI 议题假设示例中平衡代表性、防操纵与透明度,推动有意义的民主参与。
代码生成变便宜后,“是否做这个需求”的评审成本往往高于写代码本身。用 AI 先产出最小可运行补丁,能把抽象的范围争论转为具体证据:四行代码加测试即可上线;触及权限或数据保留等核心契约的请求则暴露真实复杂度。关键区分不是“能否生成”,而是“人类能否 confidently review 并承担后续所有权”。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
DharmaOCR 通过领域专精与两阶段训练(监督微调 + DPO),在巴西葡萄牙语基准上得分 0.925,显著高于 Mistral OCR4 的 0.798 与 Unlimited-OCR 的 0.7587。监督微调将参数集中于巴西葡萄牙语的词汇、句法与文档结构,DPO 阶段则降低推理时的退化率与不稳定输出。两阶段缺一不可:微调建立领域能力,DPO 确保该能力在生产条件下稳定。
Google DeepMind 与 Isomorphic Labs 发布 bioresilience 联合方案,通过预防、检测、响应三方面应对生物安全威胁。AlphaFold 映射近所有已知蛋白质三维结构,AlphaGenome 揭示基因组功能,IsoDDE 提供药物设计真实精度。AlphaEvolve 优化宏基因组测序算法以更快检测新疫情,SynthID 水印技术正适配生物序列筛查。
MIT与Red Hat、IBM合作提出GIFT(Geometric Inference Feedback Tuning)框架,通过推理时扩展利用视觉语言模型自身的近似正确答案生成训练数据,自动修正模型在图像转CAD代码任务中的错误。实验表明,GIFT仅用约20%的计算量即可生成更准确的CAD程序,且生成的3D模型几何形状与真实模型更吻合。
推荐理由:该方法利用模型自身错误生成训练数据,以更低计算成本提升图像转CAD代码的准确性。
summary_zh: Together AI 解释推理服务可靠性的分层含义:99% 需快速检测并调度故障节点,99.9% 要求双设施持续部署与权重冗余,99.99% 需预留跨区域容量以应对整区宕机。
Hugging Face 检测到生产基础设施遭自主 AI 代理系统入侵,未经授权访问了部分内部数据集和凭证,未发现公开模型、数据集或 Spaces 被篡改。攻击通过恶意数据集利用数据处理管道中的代码执行路径发起,代理框架在数千个短期沙箱中执行了超过 17,000 条操作。
推荐理由:Hugging Face 披露了由自主 AI 代理系统驱动的入侵事件,并分享了用自有开源模型进行取证分析的实践经验。
IBM Research 在 Hugging Face 博客指出,将路由引入 Agent 系统时,模型选择会迅速演变为系统优化问题。实际成本受缓存、基础设施和负载模式影响,GPT-4.1 在标价更低的情况下反而比 Claude Sonnet 4.6 更贵;路由需同时平衡成本、质量、延迟、合规与可靠性。
推荐理由:从成本与系统优化角度重新审视路由设计,为构建 Agent 系统提供可迁移的权衡思路。
Meta 提出分层兴趣表征(Hierarchical Interest Representation),作为广告系统的上游表征层,基于数十亿交互数据端到端训练。
Hugging Face 发布 Real World VoiceEQ 基准,从声学信息层面评估语音交互的人本质量,覆盖ASR、TTS、S2S与语音理解,超40款开源与闭源模型参与。评测基于超过100万条人类评分,包含78.5万条TTS与4.8万条STS评分,并指出传统基准在噪声、口音、情绪等真实场景下高估模型表现,语音模型在
推荐理由:原文呈现了覆盖40余款模型的评测结果与关键发现,帮助读者在语音接口成为主流交互方式的背景下重新审视现有基准的局限。
Together GPU Clusters 推出被动健康检查、自动节点修复、Slinky 1.0 等功能,覆盖 GPU 总线故障、热节流、Xid 错误等场景。配合集群详情页、外部 OIDC、启动脚本和验收测试选项,提升多团队场景下的可观测性、访问控制与自定义能力。
推荐理由:原文给出了平台健康与运维控制两方面的具体能力变化,读者可以据此评估它对现有训练与推理工作流的影响。
Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。
推荐理由:原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。
Inkling 由 Thinking Machines 发布,是一个原生接收图像、文本和音频输入的大规模多模态开源模型,总参数约 1T、活跃参数 41B,支持 1M 上下文窗口。
推荐理由:Inkling 是原生接收图音文三模态的大规模开源模型,提供 BF16 与 NVFP4 双版本及 day-0 支持的推理引擎,读者可据此评估其在多模态推理基准中的相对位置。
summary_zh: Ikigai 基于表格与时间序列数据构建基础模型,可持续接入企业多源数据,通过预测真实结果进行自我学习。该模型将企业流程数字化,提供大规模实时规划与模拟不同选项的能力。
summary_zh: MIT 开设 JARVIS Challenge,要求本科生在四周内用 AI 设计、加工、组装并测试一台 50–100 磅推力的单转子喷气发动机。
summary_zh: Kubernetes 内置指标仅覆盖 CPU 和内存,自定义 metrics exporter 通过 HTTP server 在 /metrics 端点暴露应用状态,让 Prometheus 抓取并供 HorizontalPodAutoscaler 使用。
Headlamp 推出 Kubeflow 插件,将 Notebook、Pipeline、Katib、Training Runs 和 Spark 等 Kubeflow 自定义资源直接集成到通用 Kubernetes Web UI。
推荐理由:为 Kubeflow 提供原生 Kubernetes UI 入口,运营商可在不切换工具的情况下直接查看 Pod 与自定义资源状态。
summary_zh: MIT 城市研究与规划系于 2019 年推出网络安全诊所课程(Cybersecurity Clinic),由 Jungwoo Chun 与 Lawrence Susskind 授课。
summary_zh: Headlamp 可运行在桌面端(读取 kubeconfig)或在集群内(通过 ServiceAccount 访问 API),与仅支持集群内运行、依赖 service account token 的 Kubernetes Dashboard 不同。
Google 在印度启动 ATL Saathi 试点,这款由 Gemini 驱动的 web 应用为 Tinkering Lab 教育者提供 24/7 规划与培训助手。
MIT EECS副教授Ashia Wilson与研究生Vinith Suriyakumar联合MIT Healthy ML Lab、Thorn及波士顿大学研究者,开发了一种基于高斯探测的审计方法,通过分析LoRA适配器在模型内部结构中的修改来判断模型是否被专门化用于生成儿童性虐待材料(CSAM),而无需生成任何输出。
推荐理由:该方法不生成内容即可检测模型是否被适配为产生CSAM,为平台审核开源模型提供了可扩展的新技术路径。
Amazon与密歇根大学提出HydroShear,基于水弹性接触模型并加入路径相关力追踪,准确模拟触觉剪切力。机器人仅在仿真中训练强化学习策略后直接部署到真实Franka机器人,在四项接触密集任务上平均成功率93%,远超TacSL的34%和FOTS的58-61%。
推荐理由:它用仿真解决了触觉力建模的难题,让机器人在模拟中训练后直接迁移到真实世界。
PAI 在日内瓦举办 2026 Partner Forum,与首届联合国 AI 治理全球对话同步,主题是从原则到实践的负责任 AI 落地。论坛宣布 Global AI Progress Hub 与年度 Global Responsible AI: Measures of Progress Report 两项新倡议。
GitHub 工程团队将 Copilot Code Review 的代码探索工具替换为 Copilot CLI 的共享工具(grep、glob、view),预期是干净升级,但离线基准显示成本上升、发现的问题减少。
推荐理由:同样的工具因指令与工作流不匹配反而拉低效率,调整提示词后成本下降约两成,读者可借此审视自己 Agent 的工具与指令设计。
summary_zh: Vector Institute 与韩国国家AI研究实验室(NAIRL)签署战略合作备忘录,加速前沿AI研究并促进研究员交流与知识共享。
Vector Institute 与 ESA 宣布合作,聚焦气候科学与北极监测的地球观测 AI 应用。Vector 学者 Evan Shelhamer 加入 ESA Φ-lab 担任访问教授,并在 Φ-innovation Summit 发表多模型主题演讲。合作将深度学习与 Copernicus Sentinel 卫星数据结合,推动开放、可访问的地球观测分析。
Vector Institute 介绍 Jeff Clune 等人提出的 The AI Scientist 系统,可自主完成从选题到论文撰写的完整科研流程,其生成的论文在 ICLR 2025 ICBINB 工作坊通过同行评审。
推荐理由:展示了AI系统端到端自动化科研流程的可行性,为理解自主科研代理的能力边界与扩展趋势提供了具体案例。
MIT CSAIL 团队发布 FloatForm 系统,由 21 厘米方形自主船组成,通过磁锁原结构实现自组装、拆解与重组,仅在精调位置时引入轻量中央规划器。实验中 8 个机器人完成构型转换并集体运输,仿真可扩展至 64 个;10 次试验中 4 机器人成功率为 90%、8 机器人为 70%。论文发表于 Nature Communications,源自与阿姆斯特丹合作的 Roboat 项目。
推荐理由:分布式水下机器人自组装为可编程水上基础设施提供了可扩展思路,对应急响应与公共空间重构有参考价值。
Amazon Science 发布 Rust 编写的代理 Turnstile,在模型生成时刻精确记录 token ID、log 概率、loss mask 与 MoE 路由轨迹,并导出与框架无关的 TrainingSequence。
推荐理由:原文给出了精确的 token 级记录方法,读者可据此避免 RL 训练中因重渲染导致的信号偏差。
summary_zh: Mistral Studio 现已上线,为企业的 Prompts 和 Skills 提供集中化的版本管理、归属权与审计追踪。每条指令不可变版本、可回滚、可标注(如 Production/Staging),并通过 Observability 将生产输出追溯至具体资产版本。
SensorFM 是一个大传感器基础模型,基于超过一万亿分钟、来自五百万参与者的无标注多模态可穿戴数据预训练,在心血管、代谢、睡眠和心理健康等35项判别任务上泛化,且通过 Agent classroom 可自动构建预测头。