Vector Institute 在 NeurIPS 2025 发表 80 篇 AI 研究论文
summary_zh: Vector 研究人员在 NeurIPS 2025 发表 80 篇论文,涵盖基础模型、扩散生成、强化学习与隐私保护联邦学习等方向。
summary_zh: Vector 研究人员在 NeurIPS 2025 发表 80 篇论文,涵盖基础模型、扩散生成、强化学习与隐私保护联邦学习等方向。
Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。
推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。
Ethan Mollick 亲测 Google Gemini 3,并用单条提示让模型从 2022 年推文重建出可玩的 Candy-Powered FTL 游戏。
Solveit 是一个交互式开发平台,通过对话、代码和笔记混合的工作方式,让用户逐步构建并理解代码。平台支持实例管理、实时协作、AI 交互、代码执行、文件操作、托管部署和对话导出等功能。
Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。
推荐理由:提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。
MiniMax M2 在 Ollama 云端上线,主打编码与智能体工作流。Ollama 给出在 VS Code、Zed、Droid 等工具中的接入步骤,并提供云端 API 访问。
推荐理由:原文给出模型能力变化与多工具接入入口,读者可据此判断它对现有开发工作流的影响。
Mistral AI 发布企业级生产 AI 平台 Mistral AI Studio,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
Andrej Karpathy 教程翻译版,讲解 LLM 分词原理与 Byte Pair Encoding 实现。示例用 Python 从 UTF-8 字节序列训练 BPE tokenizer,演示 get_stats、merge、encode/decode,并对比 GPT-2 与 GPT-4 的 regex 预分词差异。附 minbpe 仓库与 tiktoken 使用。
summary_zh: fast.ai 推出新版课程 How to Solve it With Code,配套 solve.it.com 平台和社区,主要面向有经验的程序员、AI 从业者与数据科学家。
summary_zh: Meta 发布基于 LLM 的 Automated Compliance Hardening(ACH)工具,结合变异测试与生成式 AI,自动生成高相关性变异体并确保测试能捕获这些变异。
Ethan Mollick 指出 AI 已能完成具有经济价值的真实任务,并以 Claude Sonnet 4.5 成功复现经济学论文研究结果为例,说明 AI 在学术复现中的潜力。OpenAI 新测试显示 AI 在专家级任务中接近人类,但主要短板是格式与指令遵循,而非幻觉。作者强调 AI 不会简单替代工作,而是改变任务构成,并提醒避免无思考地扩增内容。
summary_zh: 作者以书中"co-intelligence"概念为起点,描述 AI 从协作伙伴转向"巫师式"输出工具的趋势。作者将书和 140 篇 One Useful Thing 文章输入 NotebookLM 并用新视频概览功能生成 AI 视频,核对后发现数据准确,但过程不透明。
Vector Institute 在 ICLR 2025 发表 71 篇被接收论文,覆盖神经架构、优化、理论及多模态 AI、科学发现与负责任机器学习。ACES 自动提取事件流数据集的队列并提升可复现性;AttriBoT 用缓存激活与层次归因实现 300 倍加速,使上下文归因比生成响应快 30 倍;行动抽象方法在熵寻求 RL 与 GFlowNets 中提升样本效率并发现可解释的高层动作。
OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 两款开源权重模型,是自 GPT-2 以来首次开放大权重模型。模型采用 MoE、SwiGLU、GQA、滑动窗口注意力和 RMSNorm 等现代设计,并支持 MXFP4 量化以在单卡运行。两款模型均为推理模型,支持低/中/高推理强度调节,并在多个基准上接近 OpenAI 自有闭源模型。
Mistral 发布 Codestral 25.08,并推出包含 Codestral Embed、Devstral 与 Mistral Code 插件的企业级编程栈,支持云、VPC 与本地部署。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。
推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。
Vector 研究人员将在 2025 年 7 月于温哥华举办的 ICML 上发表 45 篇论文,涵盖 AI 安全性、医疗与环境监测等方向。亮点工作包括利用 LLM 进行自适应信息提取的框架、AutoElicit 方法,以及神经网络训练轨迹对初始条件的高度敏感性分析。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。
推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。
summary_zh: 文章论证多模态方法无法在近期实现人类水平的通用人工智能,指出真正的 AGI 需要基于物理世界模型的具身智能,而非将多种模态拼接成补丁式系统。
Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。
推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。
Mistral 发布 Agents API,将语言模型与代码执行、网页搜索、图像生成及 MCP 工具等内置连接器结合,并提供持久记忆与多智能体编排能力。SimpleQA 上 Mistral Large 和 Medium 启用网页搜索后得分分别从 23%、22.08% 提升至 75%、82.32%。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。
推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。
summary_zh: OpenAI 发布 o3 后再度引发 AGI 是否已实现的争论,文章认为 AGI 不是里程碑,不构成可操作事件,对企业、开发者、政策制定和安全均无直接影响。
summary_zh: 论文提出将 AI 视为"普通技术"的框架,区别于乌托邦/反乌托邦叙事,认为当前不应将 AI 视作类人智能或超级智能体。核心主张是 AI 的影响将按十年尺度渐进扩散,方法、应用与采纳发生在不同时空,控制权仍主要在人与机构手中。
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
summary_zh: ACM 将 2024 年 A.M. Turing 奖授予 Richard Sutton 与 Andrew Barto,表彰强化学习(RL)领域的奠基性贡献。
Vector Applied Scientist David Emerson 等人提出通用提示模板 Abstract ScreenPrompt 和 ISO-ScreenPrompt,在 10 个临床领域的系统综述上实现 97.7% 加权灵敏度和 85.2% 加权特异性(摘要筛选),全文筛选达 96.5% 灵敏度和 91.2% 特异性。
推荐理由:通用提示模板让大语言模型在系统综述筛选中达到高灵敏度与特异性,为自动化证据筛选提供了可迁移方法。
Mistral AI 展示了 TranscriptToPRDTicket agentic workflow,利用 Mistral Large 2 自动将会议纪要转化为 PRD 和开发工单。该流程由 PRDAgent 和 TicketCreationAgent 两个组件驱动,自动在 Linear 和 Jira 中生成结构化工单。相关实现已在 Google Colab notebook 中提供。
斯坦福 Hazy Research 团队发布 Minions 论文与开源代码,让本地小模型(如 Llama 3.2 via Ollama)与云端大模型(如 GPT-4o)协作,将大量 LLM 工作负载转移到消费设备。
推荐理由:通过本地小模型与云端大模型协作的两套协议,在显著降低远程调用成本的同时保持较高性能。
Vector 研究院 Jeff Clune 与 Shengran Hu 提出 Thought Cloning(TC)框架,通过让 AI 智能体在语言层面模仿人类思维来学习。
summary_zh: 文章列举了构建生成式 AI 应用时的四个常见陷阱:不必要地使用生成式 AI(如用 LLM 做能源调度优化,贪心调度或线性规划更可靠);将产品问题误判为 AI 问题(LinkedIn 技能匹配聊天机器人需要的是有帮助的提示而非正确答案。
summary_zh: 智能体被定义为能通过传感器感知环境并通过执行器采取行动的任何事物,其能力由环境与工具集共同决定。SWE-agent 以 GPT-4 为基础,在计算机终端和文件系统环境中执行导航、搜索、查看和编辑等操作。
summary_zh: Baoxiang Wang 于今年从港中深理工休学加入 Vector Institute,担任访问研究员,研究方向为战略智能体环境下的学习算法。
summary_zh: Vector Institute 学者在 NeurIPS 2024 发表超过 98 篇论文,涵盖贝叶斯优化、多模态生物多样性数据集与扩散模型合成数据等方向。
fast.ai 加入 Answer.AI,并发布全新课程"How To Solve It With Code",采用 Dialog Engineering 方法,通过 solveit 平台以小步迭代方式与 AI 协作编程。课程11月26日开课,适合已有编码基础、希望超越简单提示词的开发者,不适合认为 AI 可完全替代程序员的人群。
Vector Institute 营销团队通过定制生成式 AI 接口实现自动化,每年节省约 1,750 小时。12 周试点期间每位成员平均每周节省 5 小时,同时提升内容产出效率与创意水平。团队已将应用扩展至其他部门,并计划向全机构推广。
Vector Institute 研究人员开发了一款基于检索的加拿大航空旅客权益聊天机器人,使用 GPT-4 进行查询分解与去上下文化,并采用 OpenAI embeddings 进行密集检索,从官方文档中提取相关条款直接呈现给用户。
文章将幻觉限定为模型输出未被上下文或世界知识支撑的编造内容,重点讨论外在幻觉,即输出应基于预训练数据的事实性。Gekhman et al. 2024 发现微调新知识时模型学得慢,且学会后增加幻觉倾向;最佳验证表现出现在多数 Known 样本被学会、仅少数 Unknown 样本被学会时。FactualityPrompt 与 FActScore 等方法通过命名实体错误率和蕴含比来量化幻觉。
summary_zh: Continue 配合 Ollama 可在 VS Code 和 JetBrains 内本地运行开源 LLM 代码助手,支持自动补全与聊天。
summary_zh: LLM 作为自回归模型预测 token 序列,与量化交易中预测价格/交易序列在数据结构上有相似性,但金融数据噪声多、信号被有效市场竞争抵消,预测难度远高于语言。