Together GPU Clusters 新增自动扩缩容、可观测性与自愈功能
Together GPU Clusters(曾用名 Instant Clusters)新增自动扩缩容、基于角色的访问控制、全栈可观测性、自助节点修复与主动健康检查。
Together GPU Clusters(曾用名 Instant Clusters)新增自动扩缩容、基于角色的访问控制、全栈可观测性、自助节点修复与主动健康检查。
Google Research发布WAXAL开源语音数据集,覆盖27种撒哈拉以南非洲语言、超过1亿使用者,包含约1846小时ASR转录语音和565小时TTS高质量录音,采用CC-BY-4.0许可。
推荐理由:开源语音数据集覆盖27种撒哈拉以南非洲语言,为低资源语言语音技术提供了可复用的数据基础。
Together AI 在首届 AI Native Conf 发布七项更新,涵盖 FlashAttention-4、Together Megakernel、together.compile、Reinforcement Learning API、ThunderAgent、ATLAS-2 与 CPD。
推荐理由:七项发布覆盖内核、强化学习与推理优化,读者可据此评估 Together 在生产部署与训练加速上的最新能力边界。
FlashAttention-4 在 B200 上 BF16 最高达 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3×、比 Triton 快 2.7×。通过前向 softmax 与 MMA 重叠、TMEM 缓存中间结果、2-CTA MMA 降共享内存流量,以及确定性模式提升可复现性。
推荐理由:原文给出了 B200 上的具体吞吐数据和对比倍数,读者可据此评估 FlashAttention-4 在实际训练中的加速潜力。
Together AI 发布缓存感知的预填充-解码分离架构(CPD),将推理分为 Pre-Prefill、Prefill 和 Decode 三层,通过缓存复用和 RDMA 共享 KV cache 让暖请求绕过冷请求的预填充队列。
推荐理由:通过区分冷热请求并引入三级 KV cache 层次,在长上下文混合负载下将可持续 QPS 提升约 35–40%。
Brown大学研究者联合心理健康专业人员发现,即使指令使用CBT等成熟疗法,LLM仍持续违反专业伦理标准。研究识别出15项伦理风险并归为五类,包括缺乏情境适应、治疗协作不当、欺骗性共情、歧视及危机管理缺失,呼吁建立AI心理咨询的伦理、教育与法律标准。
summary_zh: Together AI 发布了全新品牌视觉,由 Pentagram 设计公司打造,表达开放、连接与共享规模的理念。新视觉围绕 AI 全生命周期整合开源创新、前沿系统研究与开发者体验。
summary_zh: Vector Institute 于 2 月 19-20 日举办第三届 Remarkable 2026 大会,吸引逾 1,500 名研究者与产业人士参与。
Meta 开源 RCCLX(基于 RCCL 的增强版),集成 Torchcomms 并将 CTran 移植到 AMD 平台,支持 AllToAllvDynamic 等特性。新增 Direct Data Access 与低精度集合通信,在 MI300X 上解码小消息延迟降低 10–50%,前向计算加速 10–30%,端到端推理延迟下降约 9–10%、吞吐提升约 7%,GSM8K 偏差约 0.3%。
推荐理由:原文给出 AMD 平台通信库的能力变化与量化结果,读者可据此评估 RCCLX 对现有训练与推理工作流的实际影响。
summary_zh: Ollama 0.17 将 OpenClaw 个人 AI 助手的启动简化为单条命令 `ollama launch openclaw --model kimi-k2.5:cloud`,自动处理安装与配置。
Together AI 提出 CDLM 训练方案,让扩散语言模型在块因果掩码下做多 token 最终化并启用精确块级 KV 缓存。实验显示 CDLM–Dream 在 GSM8K-CoT 与 MBPP-Instruct 上分别提速 11.2x 与 14.5x,多数任务精度变化很小。
推荐理由:通过训练让扩散语言模型在块内自回归解码并启用精确 KV 缓存,在保持质量的同时显著减少推理步数与延迟。
Ollama 在 Claude Code 中新增 Subagents 与网页搜索功能,无需 MCP 服务器或 API Key。Subagents 可并行执行文件搜索、代码探索和研究等任务;网页搜索内建于 Anthropic 兼容层,模型需要最新信息时由 Ollama 直接返回结果。推荐云端模型包括 minimax-m2.5、glm-5 与 kimi-k2.5。
推荐理由:原文给出无需 MCP 与 API Key 的入口,读者可据此判断它能否降低 Claude Code 的接入成本。
Sandia国家实验室研究人员Brad Theilman和Brad Aimone在Nature Machine Intelligence发表新算法,使类脑硬件能够高效求解偏微分方程(PDEs)。该成果展示了类脑系统在流体动力学、电磁场和结构力学等科学工程问题上的计算能力,并可能为类脑超级计算机和降低核武器模拟能耗提供新路径。
Together AI 发布 Dedicated Container Inference,支持用户以 Docker 容器方式部署自定义生成式媒体模型,并由平台负责自动扩缩容、队列、流量隔离与监控。客户实测视频生成等任务推理速度提升 1.4–2.6 倍;在 Together GPU Cloud 训练的模型可直接部署,无需传输产物。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
密歇根大学团队开发的 Prima 视觉语言模型在 30,000 份 MRI 研究中准确率约 97.5%,并能判断紧急程度、自动通知相应专科医生。该模型使用 20 万份 MRI 和 560 万序列训练,整合临床病史与医嘱信息,研究发表于 Nature Biomedical Engineering。
Mistral 发布 Voxtral Transcribe 2,包含 Voxtral Mini Transcribe V2 批量模型和 Voxtral Realtime 实时模型。
推荐理由:原文给出了两款模型的价格与延迟配置,读者可以据此对比其成本与实时性是否匹配自身场景。
OpenClaw 是连接 WhatsApp、Telegram、Slack、Discord、iMessage 等通讯平台与 AI 编程助手的本地化网关,保持对话和代码隐私。
NASA 毅力号在 12 月 8 日和 10 日完成首次由生成式 AI 规划的火星行驶,由 JPL 与 Anthropic 合作使用 Claude 模型,基于 HiRISE 图像和地形数据规划路点,并在数字孪生中验证超 50 万遥测变量后上注。8 日行驶 689 英尺(210 米),10 日行驶 807 英尺(246 米),NASA 官员表示该技术可降低运营商负担并提升远距离探测效率。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。
Ollama 推出 `ollama launch` 命令,一键设置并运行 Claude Code、OpenCode、Codex 等编程工具,无需配置环境变量或配置文件。
summary_zh: Vector Institute 举办的 Foundation Models for Science Workshop 聚焦科学场景下数据稀缺、 stakes 高且来源 disconnected 的 AI 落地挑战,归纳出 annotation bottleneck、trust gap 与 lab-to-production leap 三大主题。
哥伦比亚工程团队在 Science Robotics 发表论文,首次构建能通过自学习和观察人类视频控制唇部运动的机器人。机器人利用 26 个面部电机,通过镜中自我探索和 YouTube 人类语音/歌唱视频学会多语言唇形同步,并演唱了 AI 生成专辑中的歌曲。研究指出唇部运动是恐怖谷的重要成因,结合对话 AI 后有望提升人机情感连接,但团队也承认伦理风险。
Ollama v0.14.0 起兼容 Anthropic Messages API,Claude Code 可通过 --model 指定本地模型(如 gpt-oss:20b、qwen3-coder)或云端模型(如 glm-4.7:cloud、minimax-m2.1:cloud)运行,并支持工具调用、流式对话、系统提示与视觉输入。
推荐理由:Ollama 兼容 Anthropic API 后,Claude Code 可直连本地或云端开源模型,为开发者提供无需切换平台即可替换模型的选择。
OpenAI Codex CLI 可通过 Ollama 使用 gpt-oss:20b、gpt-oss:120b 等开源权重模型,默认调用本地 gpt-oss:20b。安装后执行 `codex --oss` 即可启动,`-m` 参数可切换模型,Ollama Cloud 上的模型同样可用。Codex 需要至少 32K tokens 的大上下文窗口。
剑桥大学等机构研究团队在Nature Machine Intelligence发表CytoDiffusion,基于生成式AI分析血涂片图像,在白血病异常细胞检测上敏感度高于现有系统,并在不确定时主动回避错误判断。
Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。
研究团队开发出可产生并探测飞秒级UV-C激光脉冲的平台,结合超快UV-C光源与基于二维半导体(GaSe/Ga2O3)的探测器,在室温下工作。所有材料兼容规模化制造,自由空间通信验证成功,传感器还表现出线性到超线性光电响应。
Ethan Mollick 用 Claude Code(Opus 4.5)自主开发并部署了一个卖 500 个提示词的网站,全程运行 1 小时 14 分钟。文中分析了自主纠错与 agentic harness 两项进展,并介绍紧凑上下文、技能(Skills)、子代理(subagents)和 MCP 等机制如何扩展 AI 能力。
推荐理由:作者以亲身实验展示 Claude Code 的自主工作能力与上下文管理机制,为非程序员理解 AI 编码工具的现状与边界提供了可迁移的观察框架。
宾夕法尼亚大学与密歇根大学团队造出约 200×300×50 微米的全自主可编程机器人,可游泳、感知温度并自主决策,单个成本约一美分,由 LED 供光可持续运行数月。研究发表于 Science Robotics 与 PNAS,机器人通过电场驱动周围离子运动前进,配备完整处理器、内存与传感器,并能用跳舞抖动编码温度数据通过显微镜读取。
Ethan Mollick 亲测 Google Gemini 3,并用单条提示让模型从 2022 年推文重建出可玩的 Candy-Powered FTL 游戏。
OpenAI 与 ROOST 合作通过 Ollama 推出 gpt-oss-safeguard 推理模型,提供 20B 和 120B 两个版本,基于 Apache 2.0 许可。模型支持自定义策略解释、可配置推理强度(低/中/高),并开放完整推理过程便于调试。OpenAI 在内部评测集、2022 年 moderation 数据集和 ToxicChat 上进行了评估。
推荐理由:开源安全分类模型支持自定义策略与可调推理强度,为安全团队提供可审计、可部署的替代选项。
MiniMax M2 在 Ollama 云端上线,主打编码与智能体工作流。Ollama 给出在 VS Code、Zed、Droid 等工具中的接入步骤,并提供云端 API 访问。
推荐理由:原文给出模型能力变化与多工具接入入口,读者可据此判断它对现有开发工作流的影响。
Mistral AI 发布企业级生产 AI 平台 Mistral AI Studio,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
Ollama 在 DGX Spark 固件 580.95.05 与 Ollama v0.12.6 下测试 gpt-oss、gemma3、llama3.1、deepseek-r1、qwen3 等模型的 prefill 与 decode 速度,并给出固件升级与安装命令。
推荐理由:原文给出 DGX Spark 上多模型的量化与速度数据,读者可据此评估本地部署的吞吐与显存匹配度。
Meta 分享了在大语言模型推理中优化资源效率、吞吐量和延迟的并行技术,包括 Tensor Parallelism 的 DDA 算法、Context Parallelism 的 Pass-KV/Pass-Q 变体以及 Expert Parallelism 的 all-to-all 优化。
summary_zh: GLM-4.6 与 Qwen3-Coder-480B 已上线 Ollama 云端服务,Qwen3-Coder-30B 在新引擎中优化了工具调用的速度与稳定性。
summary_zh: fast.ai 推出新版课程 How to Solve it With Code,配套 solve.it.com 平台和社区,主要面向有经验的程序员、AI 从业者与数据科学家。
Qwen3-VL 作为 Qwen 系列最强视觉语言模型已在 Ollama 云端上线,本地将随后推出。模型支持视觉 Agent 操作 PC/移动端界面、视觉编程生成 Draw.io/HTML/CSS/JS、2D/3D 空间推理、原生 256K 上下文可扩展至 1M,以及 32 语言 OCR。
推荐理由:原文给出了 Qwen3-VL 在 Ollama 云端的入口与主要能力,读者可据此判断它对视觉 Agent 与多模态工作流的影响。
NVIDIA DGX Spark 搭载 GB10 Grace Blackwell Superchip,提供 1 petaFLOP 性能与 128GB 内存,可通过 Ollama 运行 Qwen、DeepSeek、Llama、Mistral、Gemma、Gpt-oss 等模型。Ollama 与 NVIDIA 合作针对聊天、文档处理、代码及多模态工作流进行性能优化。
summary_zh: Meta 发布基于 LLM 的 Automated Compliance Hardening(ACH)工具,结合变异测试与生成式 AI,自动生成高相关性变异体并确保测试能捕获这些变异。