跳到正文

#开源/仓库

今日 0 条
9月21日周一
  1. Hugging Face Blog62

    像物理学家一样剪枝大语言模型:块移除作为约束二元优化问题

    Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。

    推荐理由:把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。

8月25日周二
  1. Hugging Face Blog66

    Quantization-Aware Healing:压缩后的 4 位模型超越全精度原版

    Multiverse Computing 提出 QAH 方法,对 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 后,在 9 项基准中 7 项超越原 bfloat16 检查点,并在 LiveCodeBench 上超过 120B 原版教师模型。

    推荐理由:原文给出了压缩-量化-恢复流程的对比,读者可据此判断 QAH 在训练稳定性与推理成本上的实际收益。

8月21日周五
  1. Hugging Face Blog70

    语音识别的基准优化测量方法研究

    Hugging Face 提出三种测试量化语音 ASR 模型的基准优化行为,评估了 11 个开源模型,发现高分模型在 VoxPopuli 和 LibriSpeech 上会复现基准错误转录、恢复被掩码数字,并依据声学线索切换拼写变体。相关脚本和未归一化输出已开源。

    推荐理由:原文给出三种可复现的测试方法,读者可据此自行评估语音模型在真实场景中的泛化能力。

8月19日周三
  1. MIT News · AI72

    MIT CSAIL研究:生成图像常无法追溯至训练数据

    MIT CSAIL团队提出"归因衰减"现象并构建扩散集成架构,实现大规模精确删除反事实模型。实验显示训练数据越大,单个样本对输出影响越小,且该方法在多个数据集和度量下保持一致。

    推荐理由:研究为生成图像的训练数据归因提供了首个精确删除方法,提示大规模模型中个体数据影响可能不可追溯。

8月17日周一
8月10日周一
  1. Hugging Face Blog62

    高效知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失

    Multiverse Computing 提出高效知识蒸馏方法,通过缓存教师模型 top-100 logits 与融合分块 KL 损失,避免构建全词汇表×序列矩阵,在单 H200 上把峰值显存从约 250GB 降至约 58GB,并在 32K 上下文下把蒸馏从四卡节点缩至单卡。代码已开源:github.com/CompactifAI/Full-Chunked-KL-Loss

    推荐理由:通过缓存 top-K logits 与融合分块 KL 损失两条改动,把蒸馏显存占用压到单卡可跑,为长上下文蒸馏提供了可复现的低成本路径。

7月1日周三
  1. Hugging Face Blog56

    ScarfBench:评测 AI 智能体在企业 Java 框架迁移中的表现

    IBM Research 发布开源基准 ScarfBench,包含 34 个应用、102 套框架实现、204 个迁移任务和约 151K 行代码,覆盖 Spring、Jakarta EE、Quarkus 之间的迁移。当前前沿智能体行为成功率不足 10%,构建成功率显著高于部署和行为验证成功率;智能体普遍高估自身构建结果,且反复回到配置层处理依赖与环境问题。

6月9日周二
  1. Amazon Science77

    亚马逊研究提出意图执行差距框架并开源 Simple Strands Agent

    亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。

    推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。

4月3日周五
4月1日周三
  1. Google Research62

    构建更好的 AI 基准:多少标注者才够用?

    Google Research 提出森林与树的(N,K)权衡框架,研究在固定预算下标注条目数与每条目标注者数量的最优配比。实验基于毒性、DICES、D3code、Jobs 等真实主观数据集,发现每条目 3–5 个标注者常不足、多数票用广度策略、意见分布用深度策略,并开源了模拟器。

    推荐理由:给出了(N,K)权衡的模拟框架和开源工具,读者可据此在有限预算下设计更可复现的评估方案。

2月23日周一
  1. Together AI64

    语音模型在街名转录上如何失败及应对方法

    Together AI 发布 SF Streets 和 US Streets 两个新基准,测试发现 15 个主流语音模型对街名的平均转录错误率达 39%,非英语母语者比英语母语者准确率低 18 个百分点,导航偏差平均多 1.2 英里。

    推荐理由:研究揭示了主流语音模型在街名转录上的显著误差,并给出小样本合成数据的改进方法,对导航和应急调度场景具有直接参考价值。

3月6日周三
  1. The Gradient60

    文本嵌入能完美编码文本吗?

    作者 Jack Morris 基于 EMNLP 2023 论文证明文本嵌入可被逆转为原始文本,并开源 vec2text 方法与代码。实验显示,对 32 token 文本经 50 步迭代修正后精确匹配率达 92%,BLEU 达 97,揭示向量数据库存在隐私与信息泄露风险。