跳到正文

全部动态

今日 131 条
4月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 AI co-clinician 研究倡议

    Google DeepMind 在 Science 发表 AI co-clinician 研究,提出三方照护框架,由医生监督下的 AI 代理辅助患者。在 98 个初级保健查询中系统仅 1 例出现关键错误,并在 OpenFDA RxQA 开放问答中超越前沿模型。

    推荐理由:双盲评估与随机模拟实验为医疗AI协作提供了可复现的验证框架,读者可借此理解多模态能力边界与安全架构的设计取舍。

  2. Google Research67

    Google Research 科学家使用 Empirical Research Assistance 的四种方式

    Google 发布 ERA 辅助科研的预印本,展示其在流行病学、宇宙学、气候与神经科学四个领域的应用。在流感、COVID-19 和 RSV 预测中,ERA 达到或接近 CDC 顶级预测水平;与 Gemini Deep Think 结合推导出宇宙弦引力辐射的统一公式;利用 GOES East 卫星数据以 10 分钟间隔反演柱平均 CO2;在斑马鱼神经回路中发现可泛化的机制性解。

    推荐理由:四类科学场景展示了 ERA 与 LLM 协作解决开放问题的潜力,为 AI 辅助科研提供可迁移方法。

4月29日周三
  1. Together AI72

    DeepSeek-V4 Pro 现已在 Together AI 上可用

    DeepSeek-V4 Pro 已在 Together AI 提供 Serverless Inference,模型级支持 1M 上下文,当前部署窗口为 512K,采用 1.6T 参数 MoE 架构,激活 49B 参数。提供 Non-Think、Think High、Think Max 三档推理模式,并针对重复长上下文给出缓存输入定价($0.20 / 1M tokens)。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

4月28日周二
  1. Together AI60

    Together AI 在 Day 0 推出 NVIDIA Nemotron 3 Nano Omni

    NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。

    推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。

4月27日周一
4月24日周五
  1. Together AI70

    Together AI 发布分布感知推测解码 DAS,RL 展开加速最高 50%

    Together AI 推出分布感知推测解码(DAS)框架,通过自适应后缀树推测器和长度感知调度,在数学和代码 RL 后训练中分别实现 50% 和 25% 的展开时间缩减,且不损失奖励质量。https://www.together.ai/blog/distribution-aware-speculative-decoding

    推荐理由:原文给出了无损加速框架和实验数据,读者可据此评估是否在自己的 RL 后训练流程中引入 DAS。

4月23日周四
  1. Weaviate Blog62

    Weaviate 1.37 发布

    Weaviate v1.37 已开源并上线云服务,新增 MCP Server、可扩展分词器、MMR 多样性搜索、查询性能分析、增量备份、Gemini 音频支持和 BlobHash 属性类型。MCP Server 让 LLM 和 IDE 可原生对接数据库;增量备份通过引用未变更数据块缩小备份体积;BlobHash 在向量化后仅持久化 SHA-256 哈希。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

4月22日周三
  1. Google Research59

    ReasoningBank:赋能智能体从经验中学习

    Google Research提出ReasoningBank框架,使智能体能从成功与失败经验中蒸馏推理模式并实现测试时自我进化。在WebArena和SWE-Bench-Verified上,基于Gemini-2.5-Flash的ReasoningBank相比无记忆基线分别提升8.3%和4.6%成功率。MaTTS通过并行与串行缩放进一步增强学习效果。

4月21日周二
  1. Weaviate Blog67

    Weaviate 发布 Engram 托管记忆服务

    Weaviate 推出托管记忆服务 Engram,基于 Weaviate 向量数据库,通过异步管道从原始数据提取、整合并持久化记忆,支持语义搜索检索。Engram 提供项目级、用户级和属性级作用域,以及可配置管道和缓冲机制,适用于聊天机器人、持续学习和多智能体系统,并计划推出 Claude Code 等集成。

    推荐理由:原文给出了记忆管理的能力变化和开放入口,读者可以据此判断它会怎样改变现有 Agent 工作流。

4月14日周二
4月13日周一
  1. Together AI82

    EinsteinArena:让智能体在开放平台上协作解决数学难题

    Together AI 发布 EinsteinArena,一个让 AI 智能体通过消息、讨论和排行榜协作与竞争的开源平台。智能体已在 11 维接吻数问题上将下界从 593 推进到 604,并在 Erdős 最小重叠问题、第二自相关不等式等多个问题上取得新的 SOTA。平台提供实时验证、公开排行榜和问题讨论线程,所有代码开源。

    推荐理由:平台让多个智能体在公开讨论区和实时排行榜上协作与竞争,推动了多个长期开放数学问题的边界。

4月7日周二
  1. ScienceDaily · AI64

    USC团队发布耐高温1300°F记忆体,可运行于700°C并加速AI矩阵运算

    USC研究团队在Science发表新型memristor记忆体,可在700°C持续工作超50小时且经历逾10亿次开关循环。器件采用钨电极、铪氧化物陶瓷与石墨烯层,利用石墨烯阻隔钨原子迁移以防止短路。研究指出该原理可迁移至其他材料,并已成立TetraMem公司推进商业化,但高温逻辑电路与量产仍待开发。

  2. Together AI28

    什么是 AI Native Cloud?

    summary_zh: AI Native Cloud 是为 AI 原生公司量身打造的新一代云基础设施,覆盖从预训练、微调到推理的完整生命周期。它以 GPU 加速、NVLink/RDMA 高速互联和统一软件栈为核心,强调研究到生产的快速转化、推理速度与成本优化,以及可按需扩展的 GPU 集群能力。

4月1日周三
  1. Together AI44

    Together AI 内核团队如何用 FlashAttention 和 ThunderKittens 重塑 AI 基础设施

    Together AI 的内核团队在 2022 年阵亡将士纪念日假期发布 FlashAttention,实现 2–3 倍加速。2025 年 3 月团队约 15 人,用一周时间基于 ThunderKittens 在 Blackwell 上开发出比 cuBLAS 快 2 倍的 FP4/FP8 GEMM 内核。团队采用学术与产业协同模式,成员来自 UCSD、普林斯顿、Caltech 等。

3月31日周二
  1. Mistral AI61

    Spaces:为人类与 AI 代理打造的 CLI

    Mistral AI 发布 Spaces CLI,为人类开发者和 AI 智能体提供统一命令行接口。文章提出交互输入应有 flag 等价、状态显式化、插件可自省等原则,并指出生成 context.json 和 AGENTS.md 可显著减少智能体错误。从单提示到部署上线仅需不到 10 分钟。

    推荐理由:原文系统阐述了让 CLI 同时服务人类与 AI 智能体的设计原则,涵盖 flag 等价、显式状态、插件化等模式,读者可据此构建更可组合、可脚本化的开发者工具。

  2. Together AI76

    Aurora:基于 RL 的自适应推测解码框架发布

    Together AI 发布开源框架 Aurora,将推测解码改为由在线推理 trace 持续训练 draft 模型的飞轮。在 Qwen3 和 Llama3 上比已训好的静态 speculator 额外提速 1.25x;域切换后约 10,000 个请求恢复接受长度;混合流量下从零在线训练 acceptance length 达 3.08、吞吐 302.3 tokens/s。代码已开源。

    推荐理由:把 speculative decoding 从静态离线训练改成在线自适应飞轮,对已训好的静态 speculator 能再叠加 1.25x 加速。

3月30日周一
  1. Ollama Blog76

    Ollama 在 Apple Silicon 上通过 MLX 加速预览

    Ollama 0.19 预览版在 Apple Silicon 上基于 MLX 框架加速,M5/M5 Pro/M5 Max 利用新 GPU 神经加速器提升 TTFT 和生成速度。引入 NVIDIA NVFP4 格式支持,并升级缓存以提高响应效率。

    推荐理由:Apple Silicon 上运行 Ollama 的速度变化和 NVFP4 支持,可帮助用户评估本地推理的性能边界。

3月29日周日
3月25日周三
  1. Google Research67

    Google 发布 Vibe Coding XR,结合 Gemini 与 XR Blocks 加速原生 XR 应用原型

    Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示转为具备物理感知的可运行 Android XR 应用,整个过程不到 60 秒。

    推荐理由:原文给出了从自然语言到可运行 Android XR 应用的端到端流程与实测基线,读者可据此判断自身原型开发是否值得接入。

  2. Google Research60

    TurboQuant:通过极致压缩重新定义 AI 效率

    Google Research 提出 TurboQuant 压缩算法,在零精度损失下将 KV cache 压缩至 3 bits,并在 H100 上实现 8x 注意力计算加速。配合 QJL 与 PolarQuant 方法,在 LongBench 等长上下文基准上保持模型性能,同时显著降低内存与检索开销。

    推荐理由:原文给出 TurboQuant 在 KV cache 和向量搜索上的压缩比与速度提升数据,读者可据此评估其工程落地价值。

3月24日周二
  1. Mistral AI65

    Mistral 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布 Voxtral TTS,4B 参数、支持 9 种语言的多语言文本转语音模型,提供自然、情感化语音生成与低延迟流式输出。模型通过 API 和 Mistral Studio 开放,定价 $0.016/1k 字符,并提供开源权重。

    推荐理由:原文给出延迟、定价与多语言支持等具体指标,读者可据此评估其是否适配自有语音 Agent 流程。

3月18日周三
  1. ScienceDaily · AI36

    AI 机器人学习更高效地采摘番茄

    大阪市立大学工学助理教授 Fujinaga 开发了一套结合图像识别与统计分析的"收获难易度估计"系统,训练机器人在采摘前评估每个番茄的难易程度。测试中成功率达 81%,约四分之一的成功采摘来自首次正面尝试失败后从侧面收获。该研究将"收获难易度"确立为可量化评估指标,推动机器人与人类协作的农业模式。

  2. Together AI62

    Together AI 扩展微调服务:支持工具调用、推理与视觉模型微调

    Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理与视觉语言模型微调,并升级训练栈以支持 100B+ 参数模型、最高 6 倍吞吐提升和 100GB 数据集。

    推荐理由:原文给出工具调用、推理与视觉模型微调的新支持,以及训练吞吐和数据集上限提升,读者可据此评估自身多轮工作流的迭代成本与可靠性改善空间。

3月17日周二
3月16日周一
3月12日周四
  1. Google Research69

    Google Research发布AI驱动的城市闪洪预报系统

    Google Research在Flood Hub推出Urban Flash Flood预报,利用新AI方法Groundsource从新闻报告中提取历史洪灾数据训练模型,可提前24小时预测城市区域闪洪风险。

    推荐理由:该方法利用新闻数据构建训练集并实现24小时城市内涝预警,为数据稀缺地区提供了可迁移的AI灾害预警思路。

  2. Google Research73

    Groundsource:利用 Gemini 将新闻报道转化为洪水数据

    Google Research 发布 Groundsource 方法,利用 Gemini 从全球新闻报道中提取洪水事件,构建了覆盖 150 多个国家、260 万条记录的开放数据集。方法结合 Google Read Aloud 和 Cloud Translation API 进行多语言文本提取与标准化,并通过 Gemini LLM 完成分类、时间推理和空间定位验证。

    推荐理由:该方法将非结构化新闻转化为结构化灾害数据,为全球洪水预测提供了新的数据基线。

  3. Google Research62

    Google AMIE真实门诊临床可行性研究发布

    Google Research与Beth Israel Deaconess Medical Center合作,发布了AMIE在真实门诊场景中的前瞻性单中心可行性研究。100名患者在就诊前通过安全网页链接与AMIE进行文本问诊,由医生实时监督。研究显示零安全触发事件,AMIE诊断符合率90%、top-3准确率75%,且患者和医生对其接受度良好。

    推荐理由:研究提供了AMIE在真实门诊场景中的安全性和可行性证据,为对话式医疗AI的临床落地提供了初步实证基础。

3月11日周三
  1. Together AI64

    Together AI 在 Day 0 上线 NVIDIA Nemotron 3 Super

    Together AI 将 NVIDIA Nemotron 3 Super 带给开发者,模型为 120B 参数(12B 激活)的混合 MoE 架构,支持 1M token 上下文和多 Token 预测,并在 AIME 2025 与 SWE Bench Verified 上达到领先精度。

    推荐理由:原文同时给出单GPU部署和1M上下文等具体能力,读者可据此判断它能否直接承载多智能体与大上下文推理工作流。