Anne Martel:用 AI 个性化癌症治疗
Anne Martel 开发 AI 系统,从医学影像(数字病理与放射影像)和临床文本数据中提取可操作信息,辅助肿瘤科医生制定个性化治疗方案。她的团队在 ICCV 展示多模态融合方法:将病理大模型与基因组数据及临床记录结合,通过多任务学习共享表征,提升预测准确性。医学影像 AI 已从跟随计算机科学进展转向贡献原创方法。
Anne Martel 开发 AI 系统,从医学影像(数字病理与放射影像)和临床文本数据中提取可操作信息,辅助肿瘤科医生制定个性化治疗方案。她的团队在 ICCV 展示多模态融合方法:将病理大模型与基因组数据及临床记录结合,通过多任务学习共享表征,提升预测准确性。医学影像 AI 已从跟随计算机科学进展转向贡献原创方法。
作者以软件工程为例反驳AI将导致大规模裁员的叙事,指出Block、Snap、Intuit等公司被报道的AI裁员实为财务压力或重组驱动,并引用WARN Act数据说明AI裁员占比极低。AI主要压缩了开发中的执行层,而决策与交付层仍需人类负责,因此软件工程师需求仍可能增长。
Ollama更新MLX引擎,在Apple Silicon上最高提速20%,并新增对NVIDIA NVFP4格式的支持,使模型量化质量损失约为q4_K_M的一半。Ollama推出快照系统,在Agent多子Agent切换、思考模型推理和分支重试时保存模型状态,避免重复处理上下文。用户可下载最新版Ollama后运行gemma4:12b-mlx模型,或通过ollama launch在编码Agent中使用。
推荐理由:Ollama在Apple Silicon上通过MLX引擎支持NVFP4格式并引入快照系统,读者可据此评估本地Agent工作流的性能提升与跨端部署可能性。
Google Research 提出 Regularized f-Divergence Kernel Tests 框架,用于更灵敏、准确地审计机器学习模型的机器遗忘效果,理论上控制假阳性率并使假阴性风险随样本量增加收敛至零。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。
推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。
AWS 宣布 EC2 M9g 和 M9gd 实例正式可用,首次搭载 Graviton5 处理器并配备 Nitro Isolation Engine。该组件是首个部署在商用云环境的形式化验证 Hypervisor,使用 Isabelle/HOL 完成 33 万行机器检查数学证明,涵盖保密性、完整性、功能正确性、无运行时错误和内存安全。
推荐理由:给出了可量化的验证规模和语言选择,读者可以据此评估云虚拟机隔离的形式化保障程度。
AWS 宣布 Graviton5 处理器正式商用,搭载于 M9g 和 M9gd 实例。相比 Graviton4,核心数从 96 增至 192,支持 DDR5-8800 内存和 PCIe gen5,每核性能提升 25%,数据库性能提升 30%。采用 3nm 工艺、四芯片架构,L3 缓存增至 192MB,并引入 Nitro Isolation Engine 实现形式化验证的云安全隔离。
GPT-4o 在 5 个词时准确率 91%,10 个词降至 57%,40 个词仅 15%;Claude 3.5 Sonnet 在 20 词内稳定,40 词时跌至 24%。GPT-5、Claude Opus 4.1、Gemini 2.5 也出现类似下降。AI 在颜色词冲突列表中难以抑制自动阅读倾向,准确率几近归零,而人类能保持稳定表现。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的技术研究资助,面向全球研究人员。资助重点研究大规模多智能体 AI 系统的群体行为,并提供框架以理解和缓解潜在风险。申请截止日期为 2026 年 8 月 8 日,获奖者预计于 2026 年秋季公布。
Together AI 获得 A-LIGN 颁发的 ISO 27001:2022 认证,其信息安全管理体系统过独立审计,覆盖全球平台及第三方数据中心。认证为企业在 Together AI 上运行生产级 AI 工作负载提供治理、访问控制、资产管理、安全开发与事件响应等方面的安全保障,并可与 SOC 2 等框架互补。
Ethan Mollick 分享其使用 Claude 5 Fable 的体验,称其在多项任务中大幅领先其他公开模型,并自主完成等时线地图绘制与学术校准软件 Concord 等复杂项目。Fable 调用多个子 Agent 进行研究、编码与自测,token 消耗高且成本约为 Opus 的两倍,同时安全护栏会频繁限制安全相关任务。
推荐理由:作者以亲测视角呈现 Mythos 级模型在复杂项目中的自主工作方式,为读者理解人机协作模式变化提供了具体案例。
summary_zh: 加拿大总理 Carney 推出「AI for All」国家 AI 战略,Vector 表示欢迎并肯定其协调加拿大 AI 资源、帮助中小企业采用 AI、提升生产力和推动突破的方向。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。
推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的 12B 多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干,16GB 显存或统一内存即可本地运行。
推荐理由:无编码器架构把视觉与音频直接接入 LLM 主干,读者可了解端侧多模态模型在显存与延迟上的取舍。
Google DeepMind Accelerator: Robotics 计划遴选 15 家欧洲早期机器人初创公司,提供 3 个月密集导师指导与技术支持,帮助将 AI 融入核心产品。入选公司覆盖物流、制造、医疗、气候与导航等领域,可使用 Google AI 栈、技术专长及 Gemini 机器人模型。
2026 年 AI 从"知道"转向"行动",Amazon 推出 Project Eluna,作为仓库运营的智能体模型,通过数字仪表板辅助运营决策。论文提出四种锚定方法:物理引导深度学习、不确定性感知推理、文本到数值桥接,以及第四种方法。UQ4CT 框架在五个基准上保持高准确率,同时将预期校准误差降低 25% 以上。
亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。
推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。
DeepMind 发布塞拉利昂预注册 RCT 结果,使用 Guided Learning 的学生数学成绩提升 +0.258 标准差,相当于 1.2-1.7 年学习进度;教师将 Gemini 融入约一半课堂的小组增益达 1.8-2.5 年。
推荐理由:在塞拉利昂的 RCT 显示 AI 辅导可带来 1.2-2.5 年学习进度增益,为教育 AI 的实证基础提供了关键数据。
Import AI 460 汇总三篇研究:Kings College London 等机构推出 SocioHack 基准,测试 AI 在信用卡积分、成绩等社会场景中利用规则漏洞的能力。
summary_zh: Sebastian Raschka 整理了 2026 年 1 月至 5 月他标记的 LLM 研究论文清单,涵盖架构与模型设计、高效训练与推理、稀疏注意力与长上下文、推理与测试时计算、强化学习、智能体系统、编码智能体、扩散语言模型及评测基准等类别。
Google 推出由 Gemini Enterprise Agent Platform 托管的 Cross-Corpus Retrieval,基于 Agentic RAG 驱动,可处理多源、多跳的复杂查询。
两篇新论文分别从 AI 机制和昆虫神经计算角度提出意识测试指标,而非仅依赖表面行为。ChatGPT 等现有大语言模型的行为表现不构成意识归因的依据,但未来不同架构的 AI 仍可能具备意识。研究者指出,判断意识应关注信息处理方式而非行为表现,人类、昆虫与机器在比较框架上趋于统一。
Ollama 0.30 发布,通过 llama.cpp 增强 GGUF 兼容并保留 MLX 引擎,NVIDIA 硬件吞吐量最高提升 20%,Vulkan 默认启用以支持 AMD 与 Intel 设备。
推荐理由:Ollama 0.30 通过 GGUF 兼容与 Vulkan 默认启用扩展了硬件覆盖,读者可据此评估自身设备能否更便捷地运行更多模型。
Ethan Mollick宣布新书Co-Existence将于10月20日出版,探讨如何与有时优于人类、有时远不如人类的AI协作。他以自身写书经历为例,展示AI在代码生成、事实核查和网站构建中的实际作用,并指出AI正成为作品的读者与推荐守门人。
Google Research在Nature发表PHRM研究,通过智能手机前置摄像头在日常使用中被动监测心率,跨肤色MAPE<10%,RHR估计MAE<5bpm达到可穿戴设备精度。研究基于35万+视频片段和近700名多样本参与者,覆盖浅色到深色皮肤群体,并公开了最大规模智能手机视频数据集及预训练PHRM-mini模型供合格研究者申请。
推荐理由:PHRM在大规模日常使用中实现跨肤色符合行业标准的心率监测,MAE低于5bpm的RHR估计达到可穿戴设备水平,为智能手机被动健康追踪设立了新基准。
NVIDIA Nemotron 3 Ultra 现已上线 Ollama 云端,为 550B 总参数、55B 活跃参数的开放模型,专为长程 Agent、编码 Agent 与复杂企业工作流设计,支持 1M 上下文与 NVFP4 推理。
推荐理由:原文给出参数规模与 NVFP4 优化,读者可据此评估它在长程 Agent 工作流中的成本与吞吐表现。
Google Research将用于Google Flood Hub的水文模型框架开源至GitHub,采用Apache 2.0许可,基于PyTorch并支持LSTM架构。框架包含2024基准测试版与升级版,新版本在有测站流域将可靠预报期延长6天、无测站流域延长1天,并可与Delft-FEWS平台集成。捷克水文气象研究所(CHMI)已合作验证并提供适配器。
Amazon AGI 团队提出 audit-then-score 协议与 DeepFact-Bench、DeepFact-Eval 两套数据集,用于评估 AI 生成的研究报告。实验显示,未经辅助的专家在已知答案集上仅 60.8% 准确率,而经过四轮审核校准后升至 90.9%;DeepFact-Eval 基于 GPT-4.1 达 83.4%,优于传统事实核查系统与既有深度研究系统。
推荐理由:原文揭示了深度研究场景下静态基准的局限,为理解 AI 评估体系的演进方向提供了可迁移方法。
Weaviate 宣布 Engram 正式在 Weaviate Cloud 上线,这是一项托管记忆与上下文服务,旨在解决长上下文退化、原始数据混乱和多 Agent 上下文碎片化问题。Engram 通过异步管道提取、去重并调和事件,生成结构化持久记忆,并依托 Weaviate 混合检索提供统一记忆与检索平台。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。
推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。
Kubernetes Dashboard 项目已归档,Headlamp 继承其可视化界面并扩展多集群可见性、应用中心视图、插件扩展及集群内与桌面灵活部署能力。Headlamp 保留浏览 workloads、编辑 manifests、遵循 RBAC 等熟悉工作流,并通过 Projects 将相关资源聚合,同时支持 Flux 插件与 AI Assistant 等功能。
Import AI 459 汇总四篇热点:UVA与Anthropic等学者指出美国AI经济名义规模约2500亿美元、质量调整增速超2600%,但GDP统计难以捕捉。
Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。
推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。
Google Research 在 I/O 2026 集中发布 Gemini for Science、Google Health 应用、Coralboard、WeatherNext、Groundsource、Gemma V4 等研究驱动产品与开源工具,并开放 Science Skills、Paper Assistant Tool 等实验性能力。
Mistral 在 AI Now Summit 2026 推出面向工业工程的 AI 栈,并宣布与 Airbus、BMW、ASML 合作,覆盖设计、仿真与生产环节。Vibe 被升级为可处理长周期任务的统一智能体,同时法国 Les Ulis 新建 10 MW 数据中心计划于 2026 年 Q3 开放。
推荐理由:原文给出了工业 AI 栈与 Vibe 智能体的能力边界,读者可据此判断 Mistral 在企业级工作流中的差异化定位。
Mistral 将 Le Chat 升级为统一的 AI 智能体 Vibe,同一订阅同时覆盖工作与编码,用户原有的对话、设置和方案自动保留。
推荐理由:Le Chat 升级为 Vibe 后把工作流与编码并入同一智能体和同一订阅,读者可了解其功能边界与定价分层。
Mistral AI 发布 Search Toolkit 公测版,这是一个可组合框架,用于构建面向 AI 应用的生产级搜索流水线。框架将摄入、检索和评估统一在单一接口下,减少团队组装基础设施的时间,并内置召回率、精确率、MRR 和 NDCG 等评估指标。
推荐理由:将摄入、检索与评估统一到单一框架,减少团队在集成上的工程开销,使其能专注于搜索质量本身的持续优化。
Amazon Science博客介绍AWS在数据中心部署的首个可扩展扁平网络RNG,采用准随机拓扑和ShuffleBox光互连设备,相比胖树架构减少69%路由器、吞吐提升33%、网络设备能耗降低40%。该网络于2024年底在爱尔兰上线,2026年4月成为AWS全球新建数据中心默认架构。
推荐理由:提供了可量化的网络性能提升和部署数据,读者可据此评估扁平化架构在云基础设施中的实际收益。
OpenJarvis 是斯坦福 Hazy Research 与 Scaling Intelligence 实验室推出的开源框架,1.0 版现已发布并内置 Ollama 支持。框架默认本地运行模型,云端可选,并追踪能耗、成本与延迟。安装脚本自动检测现有 Ollama,用户可拉取如 qwen3.5:35b 等模型,并使用晨间简报、跨文件研究和本地编码等内置代理预设。
推荐理由:原文给出本地优先框架与 Ollama 集成入口,读者可据此评估本地 Agent 工作流的可行性。
summary_zh: Amazon Research Awards(ARA)公布秋季2025评审结果,70位获奖者来自49所大学、11个国家,覆盖AI信息安全、智能体AI、自动化推理、AWS密码学、网络安全与反滥用、可持续性等6个方向。