Minions:Ollama 与前沿模型的安全隐私协作协议
Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。
推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。
Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。
推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。
Ollama 发布思考模式开关,用户可在 CLI、交互会话、脚本和 API 中启用或禁用模型的思考过程。支持的模型包括 DeepSeek R1 和 Qwen 3,API 新增 think 参数,可分离 thinking 与 content 输出。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Ollama 现在支持流式工具调用,可在生成内容的同时实时调用工具,覆盖 Qwen 3、Qwen2.5、Llama 3.1、Llama 4 等模型。新解析器通过参考模型模板识别工具调用前缀,并能在无前缀时回退解析 JSON,从而提升流式场景下的工具调用可靠性。
推荐理由:Ollama 新增流式工具调用解析器,让聊天应用可以边生成边调用工具。
Vector Institute 与 Kids Help Phone 联合开发了 FAIIR 模型,用于自动识别青少年危机对话中的关键问题并分类至 19 个心理健康标签。
推荐理由:该研究在保持公平性的同时将关键问题的识别准确率提升至 0.75,可为危机干预场景提供可迁移的方法参考。
Mistral 发布 Agents API,将语言模型与代码执行、网页搜索、图像生成及 MCP 工具等内置连接器结合,并提供持久记忆与多智能体编排能力。SimpleQA 上 Mistral Large 和 Medium 启用网页搜索后得分分别从 23%、22.08% 提升至 75%、82.32%。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。
推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。
Ollama 发布新多模态引擎,支持 Llama 4、Gemma 3、Qwen 2.5 VL、Mistral Small 3.1 等视觉模型。引擎改进包括模型模块化、图像元数据精度、图像缓存与 KV 缓存优化,并针对 Llama 4 Scout 实现分块注意力与 2D 旋转嵌入。
推荐理由:原文给出了多模态引擎的具体改进与支持的模型,读者可以据此判断本地多模态推理的可靠性与扩展方向。
Vector Institute 向安大略省 120 名顶尖 AI 研究生颁发每人 17,500 美元的 merit-based Vector Scholarship in Artificial Intelligence(VSAI),2025-26 学年总计发放 210 万美元。
Mistral 发布 Mistral Medium 3,宣称以显著更低成本提供接近前沿大模型的性能。模型在编码与 STEM 任务上接近更大更慢的竞品,API 定价为输入 $0.4 / 输出 $2 每百万 token,可在四卡及以上自托管环境部署。
推荐理由:原文给出性能与成本对比,读者可据此判断它对现有开源大模型格局的影响。
Vector Institute博士后James Requeima等人开发的Aardvark Weather模型在Nature发表论文,预报速度比传统系统快10倍、计算需求低1000倍,且仅需10%输入数据。
推荐理由:Aardvark Weather以端到端学习直接处理原始观测数据,为资源受限地区提供了可迁移的轻量级预报方法。
Kelsey Allen 加入 Vector Institute,研究自适应学习机制与推理、问题解决能力。她从粒子物理转向机器学习,关注人类认知与机器学习的类比,以及工具使用在跨物种智能中的连续谱系。她的研究曾获 Robotics: Science and Systems 2018 最佳论文奖。
summary_zh: Vector Institute 任命 Glenda Crisp 为新任 President & CEO,于 2025 年 4 月 21 日生效。
Vector Institute 对 11 个主流大语言模型进行 16 项基准的独立评估,涵盖开源模型如 DeepSeek-R1、Cohere Command R+ 与闭源模型如 GPT-4o、Gemini 1.5。
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
summary_zh: Mistral 提出用结构化输出(Structured Outputs)实现 RAG Triad 评估框架,通过 Context Relevance、Groundedness、Answer Relevance 三个指标,结合"LLM As a Judge"对检索与生成结果进行自动评分。
summary_zh: ACM 将 2024 年 A.M. Turing 奖授予 Richard Sutton 与 Andrew Barto,表彰强化学习(RL)领域的奠基性贡献。
Vector Institute 发布 Responsible AI Product Development Playbook,帮助创业团队、产品经理、设计师和技术负责人在 AI 产品开发中落实负责任 AI 原则。
Vector Applied Scientist David Emerson 等人提出通用提示模板 Abstract ScreenPrompt 和 ISO-ScreenPrompt,在 10 个临床领域的系统综述上实现 97.7% 加权灵敏度和 85.2% 加权特异性(摘要筛选),全文筛选达 96.5% 灵敏度和 91.2% 特异性。
推荐理由:通用提示模板让大语言模型在系统综述筛选中达到高灵敏度与特异性,为自动化证据筛选提供了可迁移方法。
Vector Institute 与 Be Node 宣布 Global AI Alliance for Climate Action 资助名单,CleanTech21、美国国家物候网络以及全球风险创新中心与吉尔吉斯斯坦互联网协会联合项目各获资助。
Mistral Small 3.1 正式发布,在文本指令、多模态理解和长上下文任务上超越 Gemma 3 与 GPT-4o Mini,推理速度达 150 tokens/秒。
TensorFlow 2.19 已发布,主要更新包括 LiteRT C++ API 变更、TF-Lite tfl.Cast op 支持 bfloat16,以及停止发布 libtensorflow 包。tf.lite.Interpreter 将于 TF 2.20 删除,需迁移至 ai_edge_litert.interpreter。
Mistral 推出 OCR API,支持图像和 PDF 输入,以 interleaved 文本与图片结构化输出,并作为默认文档理解模型集成到 Le Chat。API 在 la Plateforme 以 1000 页/$ 开放,批量推理每美元页数约翻倍,同时提供自托管选项。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
summary_zh: Vector Institute 宣布 Tony Gaffney 于 2025 年 3 月 6 日起转任 Special Advisor to the Chair,聚焦推动 AI 在加拿大经济生产力中的应用。
Unilever 与 Vector Institute 宣布新合作,借助其研究洞察、专业知识和人才网络推动全球 AI 创新。Unilever 已在全球部署超过 500 个 AI 项目,覆盖研发到营销等多个领域。合作进一步巩固其 Horizon3 AI Labs 在全球 AI 进展中的前沿地位。
Mistral AI 展示了 TranscriptToPRDTicket agentic workflow,利用 Mistral Large 2 自动将会议纪要转化为 PRD 和开发工单。该流程由 PRDAgent 和 TicketCreationAgent 两个组件驱动,自动在 Linear 和 Jira 中生成结构化工单。相关实现已在 Google Colab notebook 中提供。
斯坦福 Hazy Research 团队发布 Minions 论文与开源代码,让本地小模型(如 Llama 3.2 via Ollama)与云端大模型(如 GPT-4o)协作,将大量 LLM 工作负载转移到消费设备。
推荐理由:通过本地小模型与云端大模型协作的两套协议,在显著降低远程调用成本的同时保持较高性能。
summary_zh: Vector Institute 通过与 Canadian Tire Corporation、BMO、TELUS、Mount Sinai Hospital 等合作伙伴,在零售、金融、医疗和气候监测领域推进负责任 AI。
Vector 研究院 Jeff Clune 与 Shengran Hu 提出 Thought Cloning(TC)框架,通过让 AI 智能体在语言层面模仿人类思维来学习。
summary_zh: 推荐系统融合AI与个性化,通过分析用户画像、物品特征和反馈来预测偏好并生成建议。经典方法涵盖协同过滤、内容过滤和混合模型;近期进展包括深度学习、图方法、序列模型和大语言模型(如GPT)的应用。
Vector Institute 召集 20 家公司 70 余位行业领袖,围绕 AI 监管对加拿大 AI 生态的影响展开三场圆桌讨论。第一场聚焦 AI 隐私与人权,提出动态同意模型和问责框架;第二场讨论 AIDA 与劳动力市场影响,涉及再培训、AI 税收和通用基本收入;第三场探讨数据治理与知识产权,强调数据生命周期治理和标准化认证。
FairSense-AI 扩展偏见检测到文本与视觉内容,同时采用节能 AI 框架,由 Vector 团队开发。优化后 Llama 3.2 1B 每小时推理碳排放从 107,000 kg 降至 0.012 kg CO2,并使用 CodeCarbon 评估能耗。提供 Python 包,集成 LLM/VLM 进行偏见评分与风险识别,并计划接入 MIT 风险库与 NIST 框架。
summary_zh: Baoxiang Wang 于今年从港中深理工休学加入 Vector Institute,担任访问研究员,研究方向为战略智能体环境下的学习算法。
Ollama 新增结构化输出功能,可通过 JSON Schema 约束模型返回格式,并更新 Python 与 JavaScript 库。支持文本与视觉模型的结构化提取,提供 cURL、Python(Pydantic)、JavaScript(Zod)及 OpenAI 兼容接口示例,建议配合 return as JSON 与 temperature=0 使用。
推荐理由:原文给出 JSON Schema 约束输出与多语言库升级,读者可据此评估结构化输出在数据提取和一致性上的可用性。
summary_zh: Vector Institute 学者在 NeurIPS 2024 发表超过 98 篇论文,涵盖贝叶斯优化、多模态生物多样性数据集与扩散模型合成数据等方向。
Wake Vision 是一个约 600 万张图像的大规模数据集,专为 TinyML 人员检测任务设计,比此前 VWW 数据集大约 100 倍。数据集提供 Wake Vision (Large) 和 Wake Vision (Quality) 两个训练集,分别侧重规模与标注质量。
summary_zh: Vector Institute 发表新论文提出共享与组提示调优(SGPT)方法,结合通用学习与个性化学习以应对联邦学习中的数据异构问题。
summary_zh: Ollama Python library 0.4 新增将 Python 函数作为 tools 传递给模型的功能,支持完整类型提示和 Pydantic 自动生成 JSON Schema。
MLSysBook.AI 是哈佛大学 CS249r Tiny Machine Learning 课程及 HarvardX TinyML 系列扩展而来的开源"教材",覆盖数据工程、模型开发、优化、部署、监控与维护等端到端 ML 生命周期。它将核心概念映射到 TensorFlow 生态,阐明量化等原则在嵌入式设备与大型数据中心间的一致性,帮助 ML 从业者构建高效、可扩展的系统。
summary_zh: Vector Institute 通过与高校、企业和医疗机构的合作培养并连接 AI 人才,以加速 AI 落地与商业成果。去年向行业赞助方转移超过 47,000 小时知识,赞助方门户提供超 125 小时按需 Upskilling 内容,500 多名注册用户来自行业赞助方与 FastLane 公司。
Llama 3.2 Vision 已支持在 Ollama 中运行,提供 11B 与 90B 两种规格。11B 需至少 8GB VRAM,90B 需至少 64GB VRAM。用户可通过拖拽图片或添加图片路径将图像输入提示词,并使用 Python、JavaScript 库或 cURL 调用。