宾大突破:光-物质粒子(激子极化激元)驱动 AI 计算
宾大物理学家 Bo Zhen 团队开发出激子极化激元(exciton-polariton),实现全光开关,仅耗约 4 皮焦耳能量。传统光子芯片在非线性激活步骤需光-电转换,而该技术可避免这一瓶颈,有望降低大 AI 系统的能耗并支持未来芯片上的量子计算功能。
宾大物理学家 Bo Zhen 团队开发出激子极化激元(exciton-polariton),实现全光开关,仅耗约 4 皮焦耳能量。传统光子芯片在非线性激活步骤需光-电转换,而该技术可避免这一瓶颈,有望降低大 AI 系统的能耗并支持未来芯片上的量子计算功能。
summary_zh: Google DeepMind 推出 AI 研究助手 Co-Scientist,帮助 Calico Life Sciences 的专家整合衰老生物学领域的分散发现,生成可验证的新假设。
summary_zh: 爱丁堡大学生物工程师 Filippo Menolascina 使用 Co-Scientist 梳理文献,针对代谢功能障碍相关脂肪性肝炎(MASH)生成新假设。
Together AI 与 Adaption 合作,让 Adaptive Data 用户可直接在 Adaption 平台优化数据集后执行 Together Fine-Tuning。
Google DeepMind 提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步计算岛以隔离硬件故障。实验表明,该架构在 2-5 Gbps 广域网上训练 120 亿参数模型,性能与传统方法持平且速度快 20 倍以上,并能混合不同代 TPU 硬件。
Google Research 提出 Simula 框架,将合成数据生成重构为机制设计问题,通过推理驱动实现可控制的数据集构建。论文发表于 Transactions on Machine Learning Research,在网络安全、法律推理、数学等五个领域最多生成 512K 数据点,全系统一致优于简单基线,且高质量数据比单纯增加数量更有效。
USC研究团队在Science发表新型memristor记忆体,可在700°C持续工作超50小时且经历逾10亿次开关循环。器件采用钨电极、铪氧化物陶瓷与石墨烯层,利用石墨烯阻隔钨原子迁移以防止短路。研究指出该原理可迁移至其他材料,并已成立TetraMem公司推进商业化,但高温逻辑电路与量产仍待开发。
Google Research 推出 S2Vec,一个自监督框架,通过将城市地理空间数据栅格化为多层图像并使用掩码自编码学习通用嵌入向量。在社会经济预测任务的零样本地理外推上,S2Vec 表现优于 SATCLIP、GEOCLIP、RS-MaMMUT、Hex2vec 和 GeoVeX 等基线模型。但在树冠覆盖率和海拔等环境任务上仍有明显改进空间。
Google Research 发布 Groundsource 方法,利用 Gemini 从全球新闻报道中提取洪水事件,构建了覆盖 150 多个国家、260 万条记录的开放数据集。方法结合 Google Read Aloud 和 Cloud Translation API 进行多语言文本提取与标准化,并通过 Gemini LLM 完成分类、时间推理和空间定位验证。
推荐理由:该方法将非结构化新闻转化为结构化灾害数据,为全球洪水预测提供了新的数据基线。
Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。
Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。
模型在真实数据上表现糟糕往往源于数据问题,包括误导性数据、隐藏变量和虚假相关。Covid预测模型和坦克识别案例说明模型可能学到无关特征而失去泛化能力。文章建议用REFORMS清单和可解释AI工具检查模型决策依据,避免陷入机器学习陷阱。
高质量人工数据是深度学习模型训练的关键燃料,任务设计、标注者筛选与培训、数据聚合及质量保障各环节均影响最终数据质量。早期研究如1907年Nature的"Vox populi"和2009年Callison-Burch对Amazon Mechanical Turk的实验表明,通过加权方案可有效降低噪声标注者干扰,提升众包标注与专家判断的一致性。
summary_zh: 单细胞测序技术通过测序DNA和RNA在单个细胞层面探索细胞异质性,2013年Nature将其评为年度方法。scRNA-tools数据库截至2021年收录超过1000个分析工具,其中许多利用深度学习技术。
summary_zh: 本文讨论数据不足时的两种数据生成方法:数据增强与生成新数据。数据增强通过保持语义不变的图像处理、文本编辑等操作扩充样本;新数据生成则依赖预训练语言模型,利用少样本提示在上下文内学习。
Active Learning 在标注预算有限时,从无标签集里选最有价值的样本标注,以最小成本最大化模型性能提升。核心是设计打分函数 U(x),常用策略包括不确定性采样、委员会投票熵、多样性采样和预期模型变化。文中讨论主要围绕深度神经网络与批量训练模式展开。
半监督学习同时利用有标签与无标签数据训练模型,损失函数为 L = Ls + μ(t)Lu,其中 μ(t) 随训练步 ramp up。无监督损失基于一致性正则化:同一输入经不同数据增强或 Dropout 后,模型预测应保持一致。该思想被 SimCLR、BYOL、SimCSE 等自监督方法采用,Π-model 通过两次前向传播最小化输出差异。
Autoencoder 通过编码器 $g_\phi$ 和解码器 $f_\theta$ 在瓶颈层学习低维隐变量 $\mathbf{z}$,以重构输入 $\mathbf{x} \approx f_\theta(g_\phi(\mathbf{x}))$,并使用 MSE 损失优化。
summary_zh: Word embedding 将词汇映射为低维稠密向量,替代 one-hot 的高维稀疏表示,常用方法包括基于统计的 count-based 和基于预测的 context-based。