跳到正文

#数据/训练

今日 12 条
5月19日周二
5月16日周六
4月30日周四
4月22日周三
4月16日周四
  1. Google Research56

    设计真实世界的合成数据集:机制设计与从第一原理推理

    Google Research 提出 Simula 框架,将合成数据生成重构为机制设计问题,通过推理驱动实现可控制的数据集构建。论文发表于 Transactions on Machine Learning Research,在网络安全、法律推理、数学等五个领域最多生成 512K 数据点,全系统一致优于简单基线,且高质量数据比单纯增加数量更有效。

4月7日周二
  1. ScienceDaily · AI64

    USC团队发布耐高温1300°F记忆体,可运行于700°C并加速AI矩阵运算

    USC研究团队在Science发表新型memristor记忆体,可在700°C持续工作超50小时且经历逾10亿次开关循环。器件采用钨电极、铪氧化物陶瓷与石墨烯层,利用石墨烯阻隔钨原子迁移以防止短路。研究指出该原理可迁移至其他材料,并已成立TetraMem公司推进商业化,但高温逻辑电路与量产仍待开发。

3月25日周三
  1. Google Research42

    映射现代世界:S2Vec 如何学习城市的语言

    Google Research 推出 S2Vec,一个自监督框架,通过将城市地理空间数据栅格化为多层图像并使用掩码自编码学习通用嵌入向量。在社会经济预测任务的零样本地理外推上,S2Vec 表现优于 SATCLIP、GEOCLIP、RS-MaMMUT、Hex2vec 和 GeoVeX 等基线模型。但在树冠覆盖率和海拔等环境任务上仍有明显改进空间。

3月12日周四
  1. Google Research73

    Groundsource:利用 Gemini 将新闻报道转化为洪水数据

    Google Research 发布 Groundsource 方法,利用 Gemini 从全球新闻报道中提取洪水事件,构建了覆盖 150 多个国家、260 万条记录的开放数据集。方法结合 Google Read Aloud 和 Cloud Translation API 进行多语言文本提取与标准化,并通过 Gemini LLM 完成分类、时间推理和空间定位验证。

    推荐理由:该方法将非结构化新闻转化为结构化灾害数据,为全球洪水预测提供了新的数据基线。

1月9日周五
  1. ScienceDaily · AI75

    Stanford SleepFM:从单夜睡眠信号预测百余种疾病风险

    Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。

12月30日周二
  1. Sebastian Raschka12

    LLM Research Papers: The 2025 List (July to December)

    Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。

2月25日周日
2月5日周一
  1. Lilian Weng36

    高质量人工数据:收集、标注与质量保障

    高质量人工数据是深度学习模型训练的关键燃料,任务设计、标注者筛选与培训、数据聚合及质量保障各环节均影响最终数据质量。早期研究如1907年Nature的"Vox populi"和2009年Callison-Burch对Amazon Mechanical Turk的实验表明,通过加权方案可有效降低噪声标注者干扰,提升众包标注与专家判断的一致性。

1月14日周日
4月16日周六
2月20日周日
12月5日周日
  1. Lilian Weng20

    半监督学习(Semi-Supervised Learning)综述:一致性正则化与 Π-model

    半监督学习同时利用有标签与无标签数据训练模型,损失函数为 L = Ls + μ(t)Lu,其中 μ(t) 随训练步 ramp up。无监督损失基于一致性正则化:同一输入经不同数据增强或 Dropout 后,模型预测应保持一致。该思想被 SimCLR、BYOL、SimCSE 等自监督方法采用,Π-model 通过两次前向传播最小化输出差异。

8月12日周日
10月15日周日