Ollama 宣布融资 8800 万美元,全面押注开源模型
Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures、8VC 等投资方跟投。公司定位为开源模型平台,已服务 890 万开发者,并被 85% 的财富 500 强企业使用。Ollama 表示将推进无缝混合推理、新模型快速支持及云端访问,同时保持开发者对模型、数据和隐私的控制。
推荐理由:原文给出具体融资额与投资方,并说明 Ollama 在开源模型生态中的定位,读者可据此判断其后续产品走向。
Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures、8VC 等投资方跟投。公司定位为开源模型平台,已服务 890 万开发者,并被 85% 的财富 500 强企业使用。Ollama 表示将推进无缝混合推理、新模型快速支持及云端访问,同时保持开发者对模型、数据和隐私的控制。
推荐理由:原文给出具体融资额与投资方,并说明 Ollama 在开源模型生态中的定位,读者可据此判断其后续产品走向。
Robostral Navigate 是 Mistral AI 推出的8B具身导航模型,仅用单RGB相机在未见R2R-CE基准上达76.6%成功率,比多传感器方案高4.5分。模型完全自研、仅用仿真数据训练,借助前缀缓存将训练token减少22倍,再通过CISPO在线强化学习进一步提升3.2%成功率。
Hugging Face 更新 vLLM 的 transformers 建模后端,在 Qwen3-4B、Qwen3-32B、Qwen3-235B-A22B-FP8 三种模型上达到或超越原生 vLLM 吞吐。模型作者只需添加 --model-impl transformers 标志即可自动获得优化推理,无需手写自定义实现。
推荐理由:transformers 后端现已达到原生 vLLM 实现同等吞吐,模型作者无需重写代码即可在 vLLM 中获得优化推理性能。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,支持一键进入 SageMaker Studio。
Google Research在Nature Cities发表研究,在10个美国大城市开展为期6个月的实验,通过Google Maps将不到2%的出行引导至替代路线,使目标路段车速中位数提升约2%,燃料消耗下降0.5%–1.0%,全城受影响路段车速中位数提升约0.35%,高峰时段提升约0.5%,每年每城可减少数千吨CO₂e排放。
推荐理由:研究提供了大规模实证证据,说明即使少量出行协调也能带来全城速度和排放的改善。
微软在 Build 2026 发布 Foundry Managed Compute,Hugging Face 模型现可通过一键部署在 Azure 上运行。模型目录每周更新,仅包含 SafeTensors 格式的安全筛选模型,支持 vLLM、SGLang、TensorRT-LLM、NIM、TEI、llama.cpp 等运行时,并提供统一端点、Azure Monitor 指标和每部署计费标签。
推荐理由:Hugging Face 模型现可通过 Foundry Managed Compute 一键部署,微软承担了从运行时构建、安全扫描到 CVE 补丁的运维层,让企业能在自有租户中运行开源模型。
Jesse Thaler 接任 MIT 核科学实验室(LNS)主任,接替 Bolek Wyslouch。Thaler 是理论粒子物理学家,将 LNS 带入 AI 驱动发现的新阶段,并计划把 IAIFI 的跨学科框架引入 LNS。LNS 同时将参与能源部 Genesis Mission 的 AI 科研项目。
Berkeley EAIR 发表观点文章,探讨当推理成本接近零时数据系统面临的三重挑战:Data Systems For Agents(为智能体推测性查询重新设计,如共享扫描与近似答案)、Data Systems Of Agents(为多智能体集群提供结构化记忆与协调子层)、Data Systems By Agents(由智能体从零合成定制数据系统并验证正确性)。
推荐理由:原文从推理成本骤降切入,提出数据系统需为智能体重塑的三重挑战,为理解Agent与数据基础设施的共演化提供了一个可迁移的分析框架。
Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,用 hf:// URL 将 HF Bucket 或 Hub repo 挂载到 SkyPilot 任务,实现跨云 GPU 任务零 egress 读取。
推荐理由:Hugging Face Storage 成为 SkyPilot 官方存储后端,团队可在任意云上运行 GPU 任务并免费读取 Hub 数据,无需跨云拷贝或承担 egress 费用。
LeRobot v0.6.0 发布,引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新 VLA 模型(GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1)和奖励模型 API(Robometer、TOPReward)。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Partnership on AI 发布 Global AI Progress Hub 与「Global Responsible AI: Measures of Progress」年度报告,建立全球首个负责任 AI 实践公开记录。
summary_zh: PRX 团队公开了其预训练数据策略:从公开与内部数据集混合采集图像数据,用 VLM 重新标注,并以长caption 保证描述完整。流程上使用 Lance 做特征工程与数据集构建、MDS 格式流式读取;文本编码器切换至 Qwen3-VL 后改为训练时实时计算 latent,仅带来约 3–4% 吞吐量开销;图像统一以质量 92 的 JPEG 编码。
Hugging Face 推出 Hub 上的新仓库类型 kernel,并重构 CLI 与安全机制,包括可信发布者、代码签名与 manylinux_2_28 动态链接支持。
Google DeepMind 与 A24 宣布达成首个此类研究合作,把世界领先的研究实验室与最重视电影人的工作室配对,帮助艺术家开发新工作流和技术。双方将围绕多个项目展开长期研发协作,把 Google DeepMind 的创新直接嵌入创作流程,并从中获得顶尖艺术家的反馈与指导。Google 同时对 A24 进行了投资。
Vector研究人员在首尔举办的ICML 2026(7月6–11日)提交73篇录用论文,其中11篇为spotlight,主题覆盖生成式AI与视频生成、多模态与视觉语言系统、自主智能体、规划与优化理论,以及负责任AI部署、环境公平性等方向。
Mistral 发布 Leanstral 1.5,这是一个 Apache-2.0 许可的 Lean 4 形式验证模型,119B 总参数、6B 激活参数。它在 miniF2F 上达到 100%,解出 PutnamBench 587/672 题,FATE-H 为 87%、FATE-X 为 34%,权重已在 Hugging Face 开源并提供免费 API。
MIT校长Sally Kornbluth在华盛顿邮报直播活动中强调联邦资助的好奇心驱动研究对国家创新与安全的重要性,指出许多医疗与技术突破源自数十年基础研究。她提出MIT新课程在加强STEM与道德公民教育的同时,注重培养学生使用AI工具与编写提示词的能力,并强调团队协作防止AI取代学习小组。
GLAAD 发布《Build for Everyone》报告,为 AI 全生命周期提供 LGBTQ 包容与安全框架,涵盖基础模型训练、产品部署与内容审核。报告指出训练数据偏差会导致医疗 AI、内容审核等场景出现准确性问题,并建议在模型开发阶段即引入外部专家参与、提供数据访问与第三方审计,同时对民间组织给予充分补偿。
summary_zh: BAIR 2026 届博士毕业生涵盖机器人与具身智能、大语言模型与推理、计算机视觉、生成式建模、AI 安全、人机交互、AI for Science 等方向。
Hugging Face 与 Cerebras 联合展示了基于 Gemma 4 31B 的实时语音对话流水线,将语音输入、Parakeet 语音识别、Gemma 4 VLM 推理和 Qwen3TTS 语音合成串联为端到端开放架构。该流水线已在 Hugging Face Space 开放演示,代码仓库为 huggingface/speech-to-speech。
Together AI 完成 8 亿美元 C 轮融资,投资方包括 Aramco Ventures、NVIDIA、General Catalyst 等,并获得 500MW 以上算力承诺。
IBM Research 发布开源基准 ScarfBench,包含 34 个应用、102 套框架实现、204 个迁移任务和约 151K 行代码,覆盖 Spring、Jakarta EE、Quarkus 之间的迁移。当前前沿智能体行为成功率不足 10%,构建成功率显著高于部署和行为验证成功率;智能体普遍高估自身构建结果,且反复回到配置层处理依赖与环境问题。
Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。
推荐理由:Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。
summary_zh: Meta 今年迎来连续第十一年赞助 Python 软件基金会(PSF),Python 是 Meta 使用最广泛的编程语言,支撑 Instagram、Threads 后端及 PyTorch 等 AI 研究。
智能体 AI 是能采取行动(如机器人操作或订票)的 AI,与生成故事、图像的生成式 AI 不同;多数智能体以 Claude 等大语言模型为核心,外加工具包装层。训练数据不足是主要挑战,智能体需通过试错学习;编码智能体目前最成功,但高风险领域尚未准备好完全自动化。存在漏洞引入、数据泄露和技能退化等风险,未来可能需要能处理视频、物理信号等连续数据的全新架构。
summary_zh: Goldfeder、Wyder、LeCun 和 Shwartz-Ziv(2026)论文指出,优化理论、进化生物学与竞争市场均预测:在有限资源下,专业化优于通用性。
Vector Institute 发布免费开源工具 UnBias-Plus,可检测、解释并改写文本中的偏见语言,支持种族、性别、年龄和政治框架等维度。工具提供浏览器版(最多 750 词)和开发者安装包两种形式,目前仅支持英文,不验证事实准确性、不检测错误信息或 AI 生成内容。
推荐理由:原文给出具体偏差率和适用场景,读者可据此评估该工具在数据清洗与内容审核中的实际作用。
Google Research 推出 TabFM,将表格预测重构为上下文学习问题,单次前向传播即可生成零样本预测。该模型基于数亿个合成数据集训练,无需手动特征工程与超参调优,目前已开源并集成至 Google Cloud BigQuery。
Every Eval Ever 与 Hugging Face 社区评测现已实现互操作,官方提供了转换器工具,可自动将 EEE 评测记录同步为模型仓库中的 YAML 文件。数据存储已收录约 22.9 万条评测结果,覆盖 2.2 万个模型和 2200 个基准。该工具支持 MMLU-Pro、GPQA、HLE 和 GSM8K 四项基准,并在写入前自动审核冲突。
推荐理由:EEE与Hugging Face社区评测现在可互操作,转换器自动将EEE记录写入YAML文件并审核冲突,解决评测结果分散难以对比的长期问题。
Together AI 在 ICML 2026 发布九篇论文,覆盖智能体、模型塑造、算法优化、系统优化与内核五个层级。DSGym 提供 1000+ 任务统一评估框架,ThunderAgent 提升 1.5–3.6 倍智能体吞吐,TTT-Discover 用开源 120B 模型在数学、GPU 内核、算法和生物领域取得新纪录。
推荐理由:九篇论文覆盖从智能体到 GPU 内核的完整栈,读者可据此判断哪些层是当前性能瓶颈。
Ollama 0.31 在 Apple Silicon 上为 Gemma 4 启用多Token预测(MTP),在 Aider polyglot 基准上生成速度提升近 90%,且不改变模型输出。系统自动调节 draft 长度,无需配置;Ollama 还向 MLX 贡献了批量验证内核。升级方式为重新拉取 gemma4:12b-mlx 并用 ollama launch 启动编码智能体。
推荐理由:Ollama 为 Gemma 4 带来近 90% 的生成加速且无需配置,读者可据此评估 Apple Silicon 上的编码智能体工作流是否能直接受益。
Google Research在Pixel 9和10上部署冻结多Token预测架构,通过将MTP头附加到已冻结的Gemini Nano v3模型实现端侧加速。该架构利用零拷贝设计,MTP头直接交叉关注主模型KV缓存,在通知摘要和校对任务中提速50%以上,每实例节省130MB内存。
Kubernetes 社区发布 AI 辅助编码政策,要求贡献者披露 AI 工具使用、禁止将 AI 列为合著者,并强制 CLA 校验与人类审核。社区已试点 GitHub Copilot 和 CodeRabbit 等自动审查工具,同时探索用 AI 技能缓解维护者 burnout 与测试分诊。
推荐理由:Kubernetes 社区以 AI 政策应对辅助编码浪潮,强调透明与人类问责,为其他开源项目提供了可迁移的治理框架。
Headlamp 开源 Kubernetes SIG UI 项目新增 Cluster API 插件,在浏览器内提供集群资源可视化管理。插件包含集群概览、MachineDeployments/MachineSets/Machines/MachinePools 详情、集群健康仪表盘、拓扑感知、Prometheus 指标集成等功能,支持 v1beta1 和 v1beta2 版本。
Headlamp 推出 Volcano 插件,将 Job、Queue、PodGroup 等核心资源与地图视图集成到统一界面,方便检查批处理工作负载的调度状态与阻塞原因。插件提供任务详情、Pod 状态、事件、日志查看及 Suspend/Resume 等生命周期操作,但不替代 kubectl 与 Volcano CLI。
Headlamp 推出 Knative 插件,让用户在单一界面查看 KService、Revision 和 DomainMapping 等资源。插件支持编辑流量分配、查看 Prometheus 指标与自动扩缩配置,需配合 Prometheus 插件使用。当前版本为 0.3.0-beta,可通过 Headlamp Desktop 插件目录安装。
summary_zh: Scientific American 专题" The Young American Scientists "聚焦 MIT 师生与校友,探讨好奇心驱动研究对美国竞争力与国家安全的作用。
summary_zh: GLAAD 报告指出 Meta Llama 2 在 2024 UNESCO 研究中约 70% 的实例生成针对同性恋的负面内容。PAI 的 Participatory & Inclusive Demographic Data Guidelines 为 AI 开发者提供收集人口统计数据的指导,以在公平性评估中保护 LGBTQIA+ 群体。
Google Research 在 CIDR 发表论文,提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境中测试数月,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总成本降低约 5%,实际 I/O 成本影响仅 0.5%。
MIT 和 Microsoft 研究人员开发了 Murakkab 系统,开发者可用自然语言描述意图,系统自动选择模型、工具并动态配置硬件资源。测试显示,该方法在视频问答和代码生成任务中仅用约 35% 的计算量、27% 的能耗和不到 25% 的成本,同时满足性能要求。
推荐理由:原文给出了具体优化幅度和动态配置方法,读者可以据此评估云上 Agent 工作流的能效潜力。