Devstral:Mistral AI 发布开源智能体编程模型
Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。
推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。
Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。
推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
summary_zh: ACM 将 2024 年 A.M. Turing 奖授予 Richard Sutton 与 Andrew Barto,表彰强化学习(RL)领域的奠基性贡献。
Vector Applied Scientist David Emerson 等人提出通用提示模板 Abstract ScreenPrompt 和 ISO-ScreenPrompt,在 10 个临床领域的系统综述上实现 97.7% 加权灵敏度和 85.2% 加权特异性(摘要筛选),全文筛选达 96.5% 灵敏度和 91.2% 特异性。
推荐理由:通用提示模板让大语言模型在系统综述筛选中达到高灵敏度与特异性,为自动化证据筛选提供了可迁移方法。
Mistral AI 展示了 TranscriptToPRDTicket agentic workflow,利用 Mistral Large 2 自动将会议纪要转化为 PRD 和开发工单。该流程由 PRDAgent 和 TicketCreationAgent 两个组件驱动,自动在 Linear 和 Jira 中生成结构化工单。相关实现已在 Google Colab notebook 中提供。
斯坦福 Hazy Research 团队发布 Minions 论文与开源代码,让本地小模型(如 Llama 3.2 via Ollama)与云端大模型(如 GPT-4o)协作,将大量 LLM 工作负载转移到消费设备。
推荐理由:通过本地小模型与云端大模型协作的两套协议,在显著降低远程调用成本的同时保持较高性能。
Vector 研究院 Jeff Clune 与 Shengran Hu 提出 Thought Cloning(TC)框架,通过让 AI 智能体在语言层面模仿人类思维来学习。
summary_zh: Baoxiang Wang 于今年从港中深理工休学加入 Vector Institute,担任访问研究员,研究方向为战略智能体环境下的学习算法。
summary_zh: Vector Institute 学者在 NeurIPS 2024 发表超过 98 篇论文,涵盖贝叶斯优化、多模态生物多样性数据集与扩散模型合成数据等方向。
Vector Institute 营销团队通过定制生成式 AI 接口实现自动化,每年节省约 1,750 小时。12 周试点期间每位成员平均每周节省 5 小时,同时提升内容产出效率与创意水平。团队已将应用扩展至其他部门,并计划向全机构推广。
Vector Institute 研究人员开发了一款基于检索的加拿大航空旅客权益聊天机器人,使用 GPT-4 进行查询分解与去上下文化,并采用 OpenAI embeddings 进行密集检索,从官方文档中提取相关条款直接呈现给用户。
summary_zh: Continue 配合 Ollama 可在 VS Code 和 JetBrains 内本地运行开源 LLM 代码助手,支持自动补全与聊天。
summary_zh: Spotify 利用 TensorFlow 与 TF-Agents 构建离线 Spotify 模拟器,用于在真实上线前原型设计、分析和训练推荐智能体。
summary_zh: Stanford AI Lab 在 ICLR 2022(4 月 25 日至 29 日线上举办)发表了多篇论文,涵盖自主强化学习、上下文分布偏移数据集 MetaShift、基于贝叶斯推理的上下文学习解释、GreaseLM 图推理语言模型、大规模模型编辑以及基于视觉的机械臂手部感知。
斯坦福AI Lab探讨用强化学习自动评分学生编程作业游戏的可行性,指出互动编码作业评分面临状态空间大、奖励稀疏等挑战,并提出 Play to Grade Challenge。
summary_zh: 斯坦福 Alexa Prize 团队基于 Chirpy Cardinal 在 Alexa Prize Socialbot Grand Challenge 3 的交互数据,发布三篇 SIGDIAL 2021 论文,分别针对用户抱怨优化神经生成对话、处理不当用户行为的策略,以及调整用户与机器人之间的对话控制权平衡。
summary_zh: Stanford AI Lab 在 CoRL 2021 录用多篇论文,涵盖语言指令机器人、共享自主、具身智能基准、人机协作模仿学习、可微渲染与声音识别、基于示例的模型强化学习等方向。