跳到正文

全部动态

今日 780 条
7月2日周四
  1. Partnership on AI30

    Build for Everyone:GLAAD 发布 AI 全生命周期 LGBTQ 包容性框架

    GLAAD 发布《Build for Everyone》报告,为 AI 全生命周期提供 LGBTQ 包容与安全框架,涵盖基础模型训练、产品部署与内容审核。报告指出训练数据偏差会导致医疗 AI、内容审核等场景出现准确性问题,并建议在模型开发阶段即引入外部专家参与、提供数据访问与第三方审计,同时对民间组织给予充分补偿。

7月1日周三
  1. Ethan Mollick · Notes44

    The twilight of the chatbots

    前沿模型发布加速,但 Claude Fable 和 GPT-5.6 曾被政府临时限制访问。METR、英国 AI 安全研究所和 GDPval 评估显示 AI 能力超指数增长:Opus 4.7 自主运行 14 小时完成需 2-17 周人力的软件包($251 token),Fable 自主执行 9 小时复杂项目。

  2. Hugging Face Blog56

    ScarfBench:评测 AI 智能体在企业 Java 框架迁移中的表现

    IBM Research 发布开源基准 ScarfBench,包含 34 个应用、102 套框架实现、204 个迁移任务和约 151K 行代码,覆盖 Spring、Jakarta EE、Quarkus 之间的迁移。当前前沿智能体行为成功率不足 10%,构建成功率显著高于部署和行为验证成功率;智能体普遍高估自身构建结果,且反复回到配置层处理依赖与环境问题。

  3. Google DeepMind69

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。

    推荐理由:Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。

6月30日周二
  1. MIT News · AI35

    Q&A:什么是智能体 AI,它与生成式 AI 有何不同?

    智能体 AI 是能采取行动(如机器人操作或订票)的 AI,与生成故事、图像的生成式 AI 不同;多数智能体以 Claude 等大语言模型为核心,外加工具包装层。训练数据不足是主要挑战,智能体需通过试错学习;编码智能体目前最成功,但高风险领域尚未准备好完全自动化。存在漏洞引入、数据泄露和技能退化等风险,未来可能需要能处理视频、物理信号等连续数据的全新架构。

  2. Vector Institute62

    Vector Institute 发布免费开源工具 UnBias-Plus 检测并改写文本偏见

    Vector Institute 发布免费开源工具 UnBias-Plus,可检测、解释并改写文本中的偏见语言,支持种族、性别、年龄和政治框架等维度。工具提供浏览器版(最多 750 词)和开发者安装包两种形式,目前仅支持英文,不验证事实准确性、不检测错误信息或 AI 生成内容。

    推荐理由:原文给出具体偏差率和适用场景,读者可据此评估该工具在数据清洗与内容审核中的实际作用。

  3. Hugging Face Blog60

    Every Eval Ever 与 Hugging Face 社区评测实现互操作,转换器自动同步评测结果

    Every Eval Ever 与 Hugging Face 社区评测现已实现互操作,官方提供了转换器工具,可自动将 EEE 评测记录同步为模型仓库中的 YAML 文件。数据存储已收录约 22.9 万条评测结果,覆盖 2.2 万个模型和 2200 个基准。该工具支持 MMLU-Pro、GPQA、HLE 和 GSM8K 四项基准,并在写入前自动审核冲突。

    推荐理由:EEE与Hugging Face社区评测现在可互操作,转换器自动将EEE记录写入YAML文件并审核冲突,解决评测结果分散难以对比的长期问题。

  4. Together AI75

    Together AI 在 ICML 2026 发布九篇全栈前沿研究论文

    Together AI 在 ICML 2026 发布九篇论文,覆盖智能体、模型塑造、算法优化、系统优化与内核五个层级。DSGym 提供 1000+ 任务统一评估框架,ThunderAgent 提升 1.5–3.6 倍智能体吞吐,TTT-Discover 用开源 120B 模型在数学、GPU 内核、算法和生物领域取得新纪录。

    推荐理由:九篇论文覆盖从智能体到 GPU 内核的完整栈,读者可据此判断哪些层是当前性能瓶颈。

6月29日周一
  1. Ollama Blog73

    Ollama 0.31 推出 Gemma 4 多Token预测加速

    Ollama 0.31 在 Apple Silicon 上为 Gemma 4 启用多Token预测(MTP),在 Aider polyglot 基准上生成速度提升近 90%,且不改变模型输出。系统自动调节 draft 长度,无需配置;Ollama 还向 MLX 贡献了批量验证内核。升级方式为重新拉取 gemma4:12b-mlx 并用 ollama launch 启动编码智能体。

    推荐理由:Ollama 为 Gemma 4 带来近 90% 的生成加速且无需配置,读者可据此评估 Apple Silicon 上的编码智能体工作流是否能直接受益。

6月27日周六
  1. Google Research59

    Pixel上通过冻结MTP加速Gemini Nano模型

    Google Research在Pixel 9和10上部署冻结多Token预测架构,通过将MTP头附加到已冻结的Gemini Nano v3模型实现端侧加速。该架构利用零拷贝设计,MTP头直接交叉关注主模型KV缓存,在通知摘要和校对任务中提速50%以上,每实例节省130MB内存。

  2. Kubernetes AI60

    AI 时代的开源项目维护:Kubernetes 社区的应对策略

    Kubernetes 社区发布 AI 辅助编码政策,要求贡献者披露 AI 工具使用、禁止将 AI 列为合著者,并强制 CLA 校验与人类审核。社区已试点 GitHub Copilot 和 CodeRabbit 等自动审查工具,同时探索用 AI 技能缓解维护者 burnout 与测试分诊。

    推荐理由:Kubernetes 社区以 AI 政策应对辅助编码浪潮,强调透明与人类问责,为其他开源项目提供了可迁移的治理框架。

6月26日周五
  1. Kubernetes AI33

    用 Headlamp 插件更快查看 Volcano 工作负载

    Headlamp 推出 Volcano 插件,将 Job、Queue、PodGroup 等核心资源与地图视图集成到统一界面,方便检查批处理工作负载的调度状态与阻塞原因。插件提供任务详情、Pod 状态、事件、日志查看及 Suspend/Resume 等生命周期操作,但不替代 kubectl 与 Volcano CLI。

6月25日周四
  1. MIT News · AI62

    MIT 与 Microsoft 提出 Murakkab 系统,提升 AI Agent 工作流的速度与能效

    MIT 和 Microsoft 研究人员开发了 Murakkab 系统,开发者可用自然语言描述意图,系统自动选择模型、工具并动态配置硬件资源。测试显示,该方法在视频问答和代码生成任务中仅用约 35% 的计算量、27% 的能耗和不到 25% 的成本,同时满足性能要求。

    推荐理由:原文给出了具体优化幅度和动态配置方法,读者可以据此评估云上 Agent 工作流的能效潜力。

  2. Google DeepMind60

    Gemini 3.5 Flash 新增计算机使用功能,支持构建跨平台智能体

    Gemini 3.5 Flash 内置计算机使用能力,开发者可通过 Gemini API 和企业平台构建跨浏览器、移动端与桌面的自定义智能体。该功能此前仅作为独立的 Gemini 2.5 计算机使用模型提供,现原生集成至 Flash 模型,并配备提示注入对抗训练及可选的企业安全防护系统。

    推荐理由:计算机使用功能从独立模型整合进3.5 Flash,开发者可通过API和企业平台构建跨浏览器、移动端与桌面的自定义智能体,并配备提示注入防护与企业级安全机制。

6月24日周三
  1. Lilian Weng58

    Scaling Laws, Carefully:缩放律的实证回顾与拟合陷阱

    Lilian Weng 回顾了深度学习缩放律的演进:从早期学习曲线幂律,到 Kaplan 等(2020)提出大语言模型缩放律,再到 Chinchilla(Hoffmann 等 2022)重新论证计算最优分配,并讨论数据受限与重复数据下的修正方案。Kaplan 认为应更大模型、更少数据;Chinchilla 主张模型与数据等比例增长;后续工作进一步指出嵌入参数计数、数据重复和拟合方法会显著影响结论。

  2. Vector Institute62

    SONIC-O1:面向真实音视频理解的多模态大模型开源基准

    Vector Institute 发布 SONIC-O1 基准,包含约 60 小时真实音视频内容、4958 个人工验证标注,覆盖 13 个对话主题和 5 大领域。评测显示闭源模型整体领先,时序定位差距显著(Gemini 3.0 Pro 25.4% R@0.5 vs Qwen3-Omni 2.8%),且群体间存在明显差异。

    推荐理由:开源基准 SONIC-O1 揭示了现有模型在时序定位和群体差异上的明显短板,为音频视频理解研究提供了可复现的评测框架。

6月23日周二
  1. Mistral AI64

    Mistral OCR 4 发布

    Mistral 发布 OCR 4,支持 170 种语言的单容器自托管文档解析,返回边界框、区块分类与内联置信度。

    推荐理由:独立标注者平均 72% 偏好 OCR 4,配合单容器自托管与结构化输出,为企业 RAG 和智能体工作流提供了兼顾数据主权与提取精度的 OCR 方案。

  2. MIT News · AI62

    MIT发布Gleanmer芯片,低功耗实时3D建图助力小型机器人

    MIT研究人员发布名为Gleanmer的系统级芯片,仅消耗约6毫瓦功率即可实时构建详细3D地图,功耗仅为现有最佳建图芯片的2.5%。芯片采用高斯椭球(Gaussian)替代传统体素表示,并结合单遍生成与高斯融合算法,大幅降低内存与功耗,可帮助小型无人机在工业HVAC系统等复杂环境中避障规划路径。

    推荐理由:算法与硬件协同设计让低功耗实时3D建图成为可能,为小型自主机器人和轻量AR设备提供了新的能效路径。

  3. Together AI66

    ParallelKernelBench:前沿大语言模型尚不能编写高效多GPU内核

    Together AI发布ParallelKernelBench(PKB)开源基准,包含87个来自真实代码库的多GPU内核生成问题,要求模型用CUDA内核替代PyTorch+NCCL并通过NVLink直接通信。

    推荐理由:基准揭示前沿模型在多GPU内核生成上正确率与速度优势均有限,为分布式优化研究提供了可复现的测试平台。

6月22日周一
  1. Interconnects82

    GLM-5.2 是开放智能体的关键一步

    Nathan Lambert 亲测 GLM-5.2 后认为,它是首个在编码 harness 中表现可靠的开放权重通用智能体模型,Arena 评测中已能比肩 Claude Opus 4.8 的 max 模式。社区反响强烈,作者将其与 DeepSeek R1 类比,并指出这会给 Anthropic 带来定价压力,同时让开放模型经济迎来拐点。

    推荐理由:作者以亲测视角说明 GLM-5.2 在编码智能体工作流中的可用性,为读者判断开放模型何时能替代闭源前沿模型提供可迁移观察。