Le Chat 新增深度研究、语音对话与项目管理功能
Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。
推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。
Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。
推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。
Mistral AI 推出 AI for Citizens 计划,帮助各国政府与公共机构按本地需求部署 AI,改造公共服务。该计划已与法国、卢森堡、新加坡、荷兰、英格兰、瑞士等国的政府、国防部门、公共机构及教育机构合作。方案提供自托管、本地 AI 数据中心、SaaS 与 serverless API 等部署选择,并支持数据主权。
Mistral AI 发布 Mistral Compute,提供私有集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。
Mistral 发布企业级 AI 编程助手 Mistral Code,基于开源项目 Continue 构建,今日开放支持 JetBrains IDE 和 VSCode 的私有 beta,正式版即将推出。
Ollama 发布思考模式开关,用户可在 CLI、交互会话、脚本和 API 中启用或禁用模型的思考过程。支持的模型包括 DeepSeek R1 和 Qwen 3,API 新增 think 参数,可分离 thinking 与 content 输出。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Ollama 现在支持流式工具调用,可在生成内容的同时实时调用工具,覆盖 Qwen 3、Qwen2.5、Llama 3.1、Llama 4 等模型。新解析器通过参考模型模板识别工具调用前缀,并能在无前缀时回退解析 JSON,从而提升流式场景下的工具调用可靠性。
推荐理由:Ollama 新增流式工具调用解析器,让聊天应用可以边生成边调用工具。
Mistral 发布 Agents API,将语言模型与代码执行、网页搜索、图像生成及 MCP 工具等内置连接器结合,并提供持久记忆与多智能体编排能力。SimpleQA 上 Mistral Large 和 Medium 启用网页搜索后得分分别从 23%、22.08% 提升至 75%、82.32%。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Ollama 发布新多模态引擎,支持 Llama 4、Gemma 3、Qwen 2.5 VL、Mistral Small 3.1 等视觉模型。引擎改进包括模型模块化、图像元数据精度、图像缓存与 KV 缓存优化,并针对 Llama 4 Scout 实现分块注意力与 2D 旋转嵌入。
推荐理由:原文给出了多模态引擎的具体改进与支持的模型,读者可以据此判断本地多模态推理的可靠性与扩展方向。
summary_zh: Mistral 提出用结构化输出(Structured Outputs)实现 RAG Triad 评估框架,通过 Context Relevance、Groundedness、Answer Relevance 三个指标,结合"LLM As a Judge"对检索与生成结果进行自动评分。
Vector Institute 发布 Responsible AI Product Development Playbook,帮助创业团队、产品经理、设计师和技术负责人在 AI 产品开发中落实负责任 AI 原则。
TensorFlow 2.19 已发布,主要更新包括 LiteRT C++ API 变更、TF-Lite tfl.Cast op 支持 bfloat16,以及停止发布 libtensorflow 包。tf.lite.Interpreter 将于 TF 2.20 删除,需迁移至 ai_edge_litert.interpreter。
Mistral 推出 OCR API,支持图像和 PDF 输入,以 interleaved 文本与图片结构化输出,并作为默认文档理解模型集成到 Le Chat。API 在 la Plateforme 以 1000 页/$ 开放,批量推理每美元页数约翻倍,同时提供自托管选项。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Mistral AI 展示了 TranscriptToPRDTicket agentic workflow,利用 Mistral Large 2 自动将会议纪要转化为 PRD 和开发工单。该流程由 PRDAgent 和 TicketCreationAgent 两个组件驱动,自动在 Linear 和 Jira 中生成结构化工单。相关实现已在 Google Colab notebook 中提供。
summary_zh: Vector Institute 通过与 Canadian Tire Corporation、BMO、TELUS、Mount Sinai Hospital 等合作伙伴,在零售、金融、医疗和气候监测领域推进负责任 AI。
FairSense-AI 扩展偏见检测到文本与视觉内容,同时采用节能 AI 框架,由 Vector 团队开发。优化后 Llama 3.2 1B 每小时推理碳排放从 107,000 kg 降至 0.012 kg CO2,并使用 CodeCarbon 评估能耗。提供 Python 包,集成 LLM/VLM 进行偏见评分与风险识别,并计划接入 MIT 风险库与 NIST 框架。
Ollama 新增结构化输出功能,可通过 JSON Schema 约束模型返回格式,并更新 Python 与 JavaScript 库。支持文本与视觉模型的结构化提取,提供 cURL、Python(Pydantic)、JavaScript(Zod)及 OpenAI 兼容接口示例,建议配合 return as JSON 与 temperature=0 使用。
推荐理由:原文给出 JSON Schema 约束输出与多语言库升级,读者可据此评估结构化输出在数据提取和一致性上的可用性。
summary_zh: Ollama Python library 0.4 新增将 Python 函数作为 tools 传递给模型的功能,支持完整类型提示和 Pydantic 自动生成 JSON Schema。
MLSysBook.AI 是哈佛大学 CS249r Tiny Machine Learning 课程及 HarvardX TinyML 系列扩展而来的开源"教材",覆盖数据工程、模型开发、优化、部署、监控与维护等端到端 ML 生命周期。它将核心概念映射到 TensorFlow 生态,阐明量化等原则在嵌入式设备与大型数据中心间的一致性,帮助 ML 从业者构建高效、可扩展的系统。
Llama 3.2 Vision 已支持在 Ollama 中运行,提供 11B 与 90B 两种规格。11B 需至少 8GB VRAM,90B 需至少 64GB VRAM。用户可通过拖拽图片或添加图片路径将图像输入提示词,并使用 Python、JavaScript 库或 cURL 调用。
TensorFlow 2.18 发布,亮点包括支持 NumPy 2.0、LiteRT 代码库迁移、Hermetic CUDA 以及 CUDA 内核更新。NumPy 2.0 可能改变计算精度并引发类型错误,迁移指南已更新。CUDA 内核不再支持 compute capability 5.0,最低预编译支持为 Pascal(6.0),Maxwell 需用 TF 2.16 或从源码编译。
Vector Institute 发布了多模态数据集 Newsmediabias-plus(NMB+),包含约 90,000 篇新闻文章,覆盖文本与图像,并附带偏见分类和发布详情。该数据集面向学术研究者、NGO 及社会导向团队,用于检测虚假信息、分析媒体偏见及训练公平性模型。数据集在 Hugging Face 上以非商业许可开放。
Vector Institute 营销团队通过定制生成式 AI 接口实现自动化,每年节省约 1,750 小时。12 周试点期间每位成员平均每周节省 5 小时,同时提升内容产出效率与创意水平。团队已将应用扩展至其他部门,并计划向全机构推广。
Meta Llama 3.2 现可通过 Ollama 运行,提供 1B/3B 文本模型与 11B/90B 视觉模型。1B 和 3B 面向移动端与边缘设备本地部署,用于构建个性化端侧智能体;11B 和 90B 支持图像推理、文档理解与图表分析。原文链接:https://ollama.com/blog/llama3.2
推荐理由:原文给出本地部署入口和模型规格,读者可据此判断它对端侧隐私和即时响应的实际影响。
Bespoke Labs 发布 Bespoke-Minicheck 并已在 Ollama 上线,用于核查其他模型生成的事实性输出以减少幻觉。其通过对比文档与生成声明,输出 Yes 或 No;在 RAG 场景中可作为后处理步骤确保回答基于检索上下文。示例与代码见 GitHub。
Vector 实习生 OJ Onyeagwu 为 Partner Portal 构建了基于 Flask API 和向量数据库的语义搜索系统,并引入内容推荐轮播与 Coherent Re-rank 端点。系统根据用户 AI 技能水平与行业提供个性化推荐,数据管道在 GCP 上运行并同步 WordPress、Vimeo 与 arXiv 数据。Qdrant 向量数据库存储嵌入向量以支持高效相似度搜索。
Ollama 现在支持 Llama 3.1 等模型的工具调用,可通过 tools 字段提供可用工具并接收 tool_calls 响应。支持的模型包括 Llama 3.1、Mistral Nemo、Firefunction v2、Command-R+,OpenAI 兼容端点也已支持工具调用。
推荐理由:Ollama 为热门模型新增工具调用能力并开放 OpenAI 兼容接口,用户可据此快速接入外部工具。
TensorFlow 2.17 已发布,二进制包为计算能力 8.9 的 GPU(如 NVIDIA RTX 40 系列、L4、L40)提供专用 CUDA 内核,同时停止支持计算能力 5.0,预编译包最低支持 Pascal 架构(6.0)。TensorFlow 2.18 将放弃 TensorRT 支持,2.17 是最后一个包含 TensorRT 的版本,并将支持 Numpy 2.0。
summary_zh: Continue 配合 Ollama 可在 VS Code 和 JetBrains 内本地运行开源 LLM 代码助手,支持自动补全与聊天。
Google 在 Google IO 2024 发布开源框架 Firebase Genkit,支持在 MacOS、Windows、Linux 及 Docker 容器中通过 Ollama 本地运行开源模型 Gemma。开发者可通过 npm install -g genkit 安装并使用 ollama pull gemma 下载模型,Genkit 默认运行在 localhost:4000。
Llama 3 现已可通过 Ollama 运行,数据集为 Llama 2 的七倍,上下文从 8K 翻倍至 16K,token 词汇表扩至 128K,误拒率低于 Llama 2 的三分之一,提供 8B 与 70B 两个版本。Meta 计划后续推出 400B 参数版本,并增加多模态、多语言和更长上下文等能力。
推荐理由:原文给出 Llama 3 在数据规模、上下文和 token 上的具体升级,以及与 Llama 2 的对比,读者可据此判断是否切换现有工作流。
TensorFlow 官方宣布 XNNPack 的全连接和卷积算子支持动态范围量化,Stable Diffusion 推理速度最高提升 6.2 倍,且无需校准数据集即可启用。从 TensorFlow 2.17 起,预编译二进制默认开启该能力。
推荐理由:原文给出动态量化在多个模型上的加速数据,读者可据此评估在旧设备上部署 AI 功能的可行性。
Ollama 支持 embedding 模型,可用于构建检索增强生成(RAG)应用,将文本提示与现有文档或其他数据结合。
Ollama 在 Windows 和 Linux 上推出 AMD 显卡预览支持,所有功能均可由 AMD 显卡加速。已支持 Radeon RX 7900 XTX、7900 XT、6950 XT、Vega 64、PRO W7900、Instinct MI300X 等系列显卡,更多型号即将推出。用户可下载 Ollama for Linux 或 Windows 开始使用。
TensorFlow 2.16 已发布,默认编译器改为 Clang 17(Windows CPU wheels),默认 Keras 版本升级为 Keras 3,并支持 Python 3.12。
Ollama 推出 Windows 预览版,支持拉取、运行和创建大语言模型,内置 NVIDIA GPU 与 AVX/AVX2 加速,无需配置或虚拟化。全量模型库可用,包括视觉模型如 LLaVA 1.6,支持拖图对话。API 默认在 localhost:11434 运行并兼容 OpenAI 接口,可通过 PowerShell 等工具直接调用。
Ollama 推出对 OpenAI Chat Completions API 的内置兼容支持,可使用 cURL、OpenAI Python/JS 库及 Vercel AI SDK、Autogen 等框架本地调用模型。
推荐理由:本地 Ollama 新增 OpenAI 兼容接口,开发者可沿用既有 SDK 与工具链对接本地模型。
TensorFlow GNN 1.0(TF-GNN)正式发布,是一个经过生产验证的、用于大规模构建图神经网络(GNN)的库。它支持在 TensorFlow 中进行建模和训练,并能从大型数据存储中提取输入图。TF-GNN 从底层构建,专为异构图设计,其中不同类型和关系由不同的节点和边集合表示。
LLaVA 1.6 支持最高 4 倍像素分辨率,并在文档、图表数据上训练以提升文本识别与推理能力。模型提供 7B、13B、34B 三种参数规模,采用 Apache 2.0 或 LLaMA 2 Community License 发布,可通过 ollama run llava:7b/13b/34b 调用。
summary_zh: Ollama 正式发布 Python 和 JavaScript 官方库,可通过 pip install ollama 和 npm install ollama 安装,仅需几行代码即可将应用与 Ollama 集成。
TensorFlow 2.15.0 的 Python 包在 pip install tensorflow[and-cuda] 安装时错误依赖 tensorrt,导致部分用户安装失败或回退到 2.14。