跳到正文

全部动态

今日 771 条
9月11日周五
  1. Together AI69

    Together AI 扩展微调服务:新增模型、实时指标与更细粒度控制

    Together AI 升级微调平台,新增 GLM-5.3、Kimi K2.7、DeepSeek-V4-Flash、Qwen 3.8-27B、Gemma 4 等开源模型支持,并引入实验实时追踪、Expert LoRA、早停、任意批量大小、样本权重、预飞行校验与打包控制等功能。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  2. Kubernetes AI62

    Kubernetes v1.37 调度器支持原地 Pod 扩容抢占(Alpha)

    Kubernetes v1.37 引入 InPlacePodVerticalScalingSchedulerPreemption 特性门控,允许调度器为原地扩容被 deferred 的 Pod 主动抢占同节点低优先级工作负载。原文给出从创建 kind 集群、配置 PriorityClass、触发扩容到观察 Preempted 事件的完整演示步骤。

    推荐理由:原文给出了调度器主动抢占低优先级工作负载的机制,读者可以据此评估集群密度与关键服务响应性的平衡。

9月10日周四
  1. AIHub35

    大规模推荐系统早期检索的改进:Haruka Kiyohara 访谈

    Haruka Kiyohara 等研究者提出 Credit-assigned Policy Gradient(CA-PG)方法,用于优化大规模推荐系统中两阶段排序的早期检索策略。传统早期检索策略训练依赖监督学习,存在位置偏差导致奖励回归对齐失效的问题,且端到端训练面临探索困难与奖励信号稀疏的挑战。CA-PG 通过仅对产生高奖励的候选 item 分配梯度信用,降低方差并提升早期策略训练效率。

  2. Mistral AI39

    Cloudera 与 Mistral 达成合作,为企业数据带来专业化主权智能

    Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,支持在私有云、公有云、本地及完全气隙环境部署推理并保持控制。企业还可在受控环境用专有数据训练自有模型并保留数据与智能所有权,面向主权 AI 需求。Mistral 提到 Cloudera 平台承载 30 exabytes 客户管理数据。

  3. NVIDIA Developer · AI23

    NVIDIA 用 Nemotron 和 Palantir Foundry 将供应链专长编码为从晶圆到首 Token 的可量化流程

    NVIDIA 将全球供应链绩效定义为从 wafer-out 到 first token 的两个阶段:Time-to-rack(硅片离开 fab 到系统上架)和 Time-to-token(之后的供电、散热、网络与软件栈)。文章展示如何用 Nemotron 与 Palantir Foundry 把供应链专家知识编码为可量化、可优化的流程。

  4. Together AI60

    ThunderKittens 在 NVIDIA Vera Rubin NVL72 上新增 NVFP4/FP8 GEMM 支持

    Together AI 内核团队在 Vera Rubin NVL72 上扩展 ThunderKittens,支持 NVFP4 与 FP8 GEMM,并通过双 K 步长、独占张量内存、更大共享内存、B 侧收集器与 Early A release 等优化,将 NVFP4 推至超 22 PFLOPS,与 cuBLAS 和 CuTE DSL 竞争。

    推荐理由:原文给出了在 Vera Rubin 上优化 NVFP4/FP8 GEMM 的具体方法与性能数据,读者可迁移这些调优思路到自家 Rubin 部署。

  5. Hugging Face Blog67

    Gradio Workflow 重建 AUTOMATIC1111 工作流

    Hugging Face 用 Gradio Workflow 重建了 AUTOMATIC1111 的核心功能,形成包含 11 条媒体管道、73 个节点的单一工作流画布,涵盖文生图、高分辨率修复、图生图、提示词矩阵、VLM 问答、检测到 inpaint 掩码、ControlNet 风格标注器、背景去除、PNG Info 读取和图生视频。

    推荐理由:原文展示了用同一套画布串联多种模型与媒体管道的构建方式,读者可据此评估 gr.Workflow 在多模态工作流中的可复用性。

  6. Together AI69

    Together AI 推出抢占式计算:相同算力半价

    Together AI 公开预览抢占式计算节点,算力与标准节点相同,按 sub-hourly 计费为按需价的 50%。回收时有 5 分钟 drain 窗口,节点标注 together.ai/compute-class=preemptible,适合可 checkpoint 或重试的短实验、推理突发和批处理任务。

    推荐理由:原文给出了成本变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  7. Hugging Face Blog63

    HF Jobs 上用 LoRA 实现异步 GRPO 训练:一个存储桶、一个代理、无需 NCCL

    TRL v1.14 的 AsyncGRPOTrainer 新增 LoRA 适配器仅同步功能,结合 HF Jobs Storage Bucket 挂载,使训练与推理可运行在独立机器上,无需 NCCL。五次实验将 500 步训练从 3h27m 优化至 53min,通过 token 预算批处理和提升并发请求数将瓶颈从训练端转移到生成端。

    推荐理由:通过LoRA适配器仅同步加存储桶挂载,训练与推理可部署在独立HF Jobs上无需NCCL,五次实验将500步训练从3小时27分压缩至53分钟。

9月9日周三
  1. Mistral AI68

    Mistral 用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++

    Mistral 帮助欧洲能源运营商将 40,000 行 Fortran 77 迁移到 C++,并给出结构化智能体工作流:先构建数值 parity harness,再整理文档,最后由人类审核员驱动 coder、tester、reviewer 智能体逐模块迁移。

    推荐理由:原文给出了一套可迁移的现代化工作流,读者可以据此评估自身代码迁移中自动化与人工审查的平衡点。

  2. Interconnects33

    普通人何时能感受到 AI 的影响?

    文章指出当前 AI 对普通人生活影响有限,日常核心领域尚无直接触达,多数人仅接触到边缘或易混淆的 AI 产品。AI 行业主要服务知识型精英阶层,加剧社会不平衡,可能引发类似"恩格斯暂停"的反弹。作者认为 AI 需数十年才能真正渗透日常生活,短期内其社会影响仍被高估。