AI 伴侣机器人正填补现代家庭中的人际联结缺口
Ollobot 推出 AI 家庭伴侣机器人 OlloNi SS1,通过主动交互、情绪感知和持续在场填补现有技术的空白。全球 AI 伴侣市场预计从 2026 年的 480 亿美元增长至 2033 年的 3180 亿美元,年复合增长率 31%。
Ollobot 推出 AI 家庭伴侣机器人 OlloNi SS1,通过主动交互、情绪感知和持续在场填补现有技术的空白。全球 AI 伴侣市场预计从 2026 年的 480 亿美元增长至 2033 年的 3180 亿美元,年复合增长率 31%。
开发者可将 Claude Desktop 配置为通过 Ollama 作为第三方网关,同时使用本地模型和 Ollama 云端模型。连接后可在 Ollama 内切换 Anthropic 模型或关闭功能恢复原设置。默认关闭遥测,Ollama 对所有模型和服务执行严格零数据保留策略。
MIT工程师提出名为η-learning的机器学习方法,可在不含极端事件的历史数据中学习并生成统计上合理的极端情景,如百年一遇暴雨的可能位置、范围和强度。该方法结合点统计与空间地图约束,已应用于美国大陆极端降水模拟,相关论文发表于Nature Communications。
推荐理由:该方法不依赖历史极端事件数据即可生成罕见情景,为城市和金融等领域的风险评估提供了可迁移的新工具。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 的数据中心基础设施,双方还计划在沙特推进联合 go-to-market 策略,面向受监管行业。
荷兰代尔夫特理工大学研究人员用GPT-4o-mini解析乘客自然语言请求,如“我迟到了,开快点”,并调整安全感知运动规划控制器的参数。系统在nuPlan模拟器中测试,8种提示下按指令提升了速度或平滑度;调整后先以自然语言描述并请乘客确认,保持人在回路。评论指出该方法把LLM与主控制器分离可限制危险,但可证明安全性仍需额外验证。
summary_zh: AI 浪潮改变了工程师的工作方式,工具迭代加速、招聘门槛提高,PwC 2026 年 6 月报告指出科技、媒体和电信行业技能更替最快,WEF 2025 年《未来就业报告》预计到 2030 年 39% 的核心技能将发生变化。
Import AI 470 分析了AI在网络安全、数学和AI研究中的分化加速现象,介绍了SPADE框架如何自动化环境生成以及Hawkeye如何构建更好GPU内核,并讨论了AI权利和意识的观点。
Sebastian Raschka 讲解了 Claude 文本水印的工作原理:水印在采样阶段通过密钥与锦标赛采样引入确定性,检测时无需重新运行模型,只需用相同密钥和函数对文本计分并设阈值。移除水印需编辑未知的水印位置,可能导致文本质量下降。
Balaji Ingole在B2B电商公司Amla领导AI驱动的数字转型项目,开发AI智能体帮助制造商在电商平台自动完成商品上架。传统商品设置需手动处理数千产品、耗时2至3个月,AI工具可大幅缩短这一流程。目前文章未披露具体模型版本、参数规模或benchmark分数。
Google Research 提出 Biomarker Discovery Framework,一个多智能体系统,用于从可穿戴传感器数据中优先排序候选生物标志物。在三个队列共9,279名参与者-观测中,框架自主识别了41个心理健康和25个代谢候选数字生物标志物。框架结合假设生成、统计分析、对抗验证和文献推理,通过11项内部检查电池分配报告标签,保持统计严谨性与人类监督。
Amazon 发布开源基准 SOP-Bench,覆盖 12 个业务领域、2000+ 任务,把专家撰写的真实 SOP 与工具及答案对齐来评估智能体。实验显示升级模型未必提升表现、工具过多会降低成功率,且没有一种模型+智能体组合在所有流程中占优。
推荐理由:原文给出基线模型在真实业务 SOP 上的失败模式,读者可据此判断自研智能体在部署前应重点测试哪些环节。
Spotfire Industry Pro 演示了如何利用 Agentic AI、跨域可视化和下沉式计算,在数十亿数据点中加速多领域根因调查。Agentic AI 自动完成跨域分析与可视化生成,帮助半导体工程师在不移动数据的前提下连接不同系统的洞察。
作者分享新个人 Agent 的文件结构,包含 AGENTS.md、code.md、todos.md、memory.md、log.md,并指出 git 历史可替代 log.md;记忆方面倾向手动维护最小文件而非自动保存,同时用子文件夹组织记忆指针。文中还对比了 Claude Cowork 与 ChatGPT 的异同。
summary_zh: Google DeepMind 回顾十五年来从 Atari 到 EVE Online 的游戏 AI 研究,与 Fenris Creations 等游戏工作室合作开发 SIMA 多世界智能体。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,把匿名聚合的移动性模式与 Gemini 的文本嵌入对齐,为地点生成兼顾身份与动态功能的嵌入向量。在公开基准上,该方法在访问意图预测上最高取得 81.9% 的相对提升,价格水平分类提升 75.1%,忙碌度估计准确率提升 24.7%。
Papers with Code 构建混合搜索系统,结合 PostgreSQL 全文检索与 pgvector 语义检索,并使用 RRF 算法融合结果。系统依赖 Hugging Face Jobs 进行批量 embedding 构建、Storage Buckets 存储持久化产物、Inference Endpoints 提供低延迟在线查询 embedding。
Hugging Face 提出三种测试量化语音 ASR 模型的基准优化行为,评估了 11 个开源模型,发现高分模型在 VoxPopuli 和 LibriSpeech 上会复现基准错误转录、恢复被掩码数字,并依据声学线索切换拼写变体。相关脚本和未归一化输出已开源。
推荐理由:原文给出三种可复现的测试方法,读者可据此自行评估语音模型在真实场景中的泛化能力。
Together AI 在 113 个 DeepSWE 任务、每侧 452 次 rollout 上对比 GLM-5.3(max)与 GPT-5.6 Sol(max)。
推荐理由:同一跑道上 GLM-5.3 以一半价格逼近 Sol,在重试和覆盖率上反而反超,读者可据此设计前端开源、后端旗舰的级联路由。
Together AI 在 DeepSWE 上对比 GLM-5.3 与 Claude Fable 5:首次尝试通过率 69.0% vs 69.7%,GLM-5.3 每次调用 $3.99。
推荐理由:在精度相近时,GLM-5.3 以五分之一成本覆盖更多任务,为预算有限的工程团队提供了清晰的选型与路由依据。
summary_zh: MIT 研究人员开发了预测电化学合成氨催化剂性能的新方法,通过密度泛函理论模拟替代试错筛选,可在数年内加速寻找使该方法与 Haber-Bosch 工艺具备成本竞争力的催化剂化合物。
Liquid AI发布LFM2.5-DSpark推测解码草稿模型,为LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B三款模型提供最高3.2倍GPU加速与最高2.87倍端侧加速。函数调用延迟平均降低57%,llama.cpp与SGLang已支持首日集成。
Skala 1.1 在 GMTKN55 上加权误差达 2.8 kcal/mol,在 55 个类别中 32 个达到最优,同时保持半局域泛函的计算效率。Skala 已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP;微软研究院同步推出持续更新的性能基准报告。
推荐理由:原文给出精度提升与多软件集成进展,读者可据此评估 Skala 在现有计算化学工作流中的可用性。
个人智能体本质上只是文件与工具的连接器,记忆也仅是会话开始时读取的文件。Ben 分享了清理后的 AGENTS.md 写法:把问题视为请求回答而非修改,并预告明天展示自己搭建个人智能体的完整会话。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具让模型多步检索、打开并核对文档,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 两组基准对比一次性 RAG 与多步检索循环,读者可借此了解复杂文档检索的取舍。
Google Search 新增互动视觉、练习测验、Lens 分步讲解、笔记本和自定义文件生成 5 项 AI 学习工具。练习测验覆盖 ACT、AP、GRE、SAT 等标准化考试,由 Princeton Review 等教育合作伙伴提供内容,英文版全球免费开放。笔记本功能同步至 AI Mode,支持跨 Google 产品自动同步资料。
维尔茨堡大学团队开发出小于1微米的光驱动纳米机器人,可追踪、捕获并释放细菌。机器人通过纳米天线线对齐光的偏振方向实现转向,利用光子反冲力推进,能在实验室条件下有效"清洁"微观环境。携带细菌集群时仍可灵活机动,但速度会有所下降。
ALTK-Evolve 通过从历史轨迹中蒸馏行为指南并在推理时注入,实现无需权重更新的智能体记忆。在 AppWorld 上评估 8 个模型,发现强模型用完整指南集、弱模型用精选检索、最强模型已饱和无增益;gpt-oss-120b 以 +5% tokens 代价获得 +16.1pp TGC 提升,prompt caching 可降低生产成本。
推荐理由:同一套记忆机制在不同能力模型上呈现三种剂量效应,为读者提供了可迁移的校准思路而非单一结论。
MIT CSAIL团队提出"归因衰减"现象并构建扩散集成架构,实现大规模精确删除反事实模型。实验显示训练数据越大,单个样本对输出影响越小,且该方法在多个数据集和度量下保持一致。
推荐理由:研究为生成图像的训练数据归因提供了首个精确删除方法,提示大规模模型中个体数据影响可能不可追溯。
Ben's Bites 发起调查,询问读者是否将 AI Agent 产品用于个人事务管理,如整理信息、处理邮件和电脑操作等。Grok Bot 吸引大量前 OpenClaw 用户,Hermes Desktop 也推出 Bot 模式模仿其体验。Codex 新增桌面活动记忆与时间线功能,可跨应用记录参考。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 风格晚交互检索,可直接加载 PyLate、Stanford-NLP ColBERT 及 ColPali 视觉文档检索 checkpoint。
推荐理由:原文给出了多向量模型的加载、评分和索引方案,读者可以据此判断它会怎样改变现有检索工作流。
Dharma AI发布约束感知GPU分配器,在七种基准场景中对比FIFO调度器,相同硬件与负载下GPU利用率提升最多33个百分点,优先级加权输出最多提升105%。该方法将实时推理视为需求曲线而非固定预留,按优先级跨整个调度 horizon 放置批量任务,并通过22维特征预测训练负载与周需求画像来支撑调度决策。
推荐理由:同一集群通过调整分配顺序而非更换硬件,实现了最高33个百分点的利用率提升,为企业GPU调度提供了可复用的约束感知方法。
Nathan Lambert 讨论开源模型生态与 Linux 类比,指出开放权重模型更接近具体软件版本,而完整开源训练配方更接近操作系统。Nvidia 通过 Nemotron 推动近开源路线以扩大推理需求,但开源训练高度依赖其融资,未来几年需形成正向反馈。另一种可能是开源模型转向效率与专业化长尾,与闭源模型形成分化。
AMD 工程师 Andrej Zdravkovic 复盘公司 AI 转型:目标 25% 生产力提升,一年后达 30%;AI 生成代码占比年初突破 20%,部分组件超 80%,整体向 50% 推进。
summary_zh: Jeremy Howard 离开 AI 领域三年后重返 fast.ai 团队,加入 Answer.AI 专注 AI 教育。Answer.AI 由 fast.ai 演变而来,团队开发了 SolveIt 工具,将问题解决分为理解、计划、执行、回顾四个阶段,让用户直接编辑 AI 回答并自行决定下一步。
Import AI 469 期报道 DiG-bench 基准,该基准包含 70 个游戏测试 AI 系统探索隐藏规则的能力。Opus 5 和 Fable 5 是最佳模型,仅在 tier 7 取得 0.2 成功率,而人类可达 100%。
Axiom Math团队使用AxiomProver首次自动验证了246素数间隙定理的形式化证明,这是数论领域的重要里程碑。该定理指出存在无穷多个差值为246的素数对,是数学界向孪生素数猜想目标推进的最新成果。文章指出形式化验证技术可作为验证AI生成代码正确性的测试平台,对网络安全和密码学具有潜在价值。
Google Research发布PhotoScan,一种基于深度学习的研究框架,可从标准2D智能手机照片估算三维身体成分指标(体脂率、A/G比、V/S比),用于预测胰岛素抵抗。
宾州大学研究团队将合成DNA与钙钛矿半导体结合,制成可在低于0.1伏下工作的memristor,功耗约为传统闪存十分之一,存储密度更高。器件在约250华氏度仍稳定运行超六周,研究已发表在Advanced Functional Materials并申请专利。
Together AI 在 DeepSWE 基准上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5:Fable 首试准确率 69.7% 高于 Pro 的 62.8%。
推荐理由:在 DeepSWE 评测中两款模型价格相差 90 倍但表现接近,读者可据此判断何时值得为 Fable 支付溢价。
Together AI 在端点层新增 A/B 实验功能,通过控制组与变体部署的百分比分流对比真实用户指标。实验挂载到端点,控制组在基础流量中按权重抽取后重新采样到变体,变体权重必须为零;支持 95/5 到 50/50 多档流量与最多 20 个变体,通过 etag 防止并发更新冲突。
推荐理由:平台在端点层原生支持 A/B 实验与滚动升级的编排,读者可据此把新模型上线从自建分流逻辑中解耦。