Meshy 跻身 a16z 消费级 AI 应用月收入 Top 50,为榜单唯一 AI 3D 公司
Meshy 位列 a16z 首份消费级 AI 应用月收入榜单第 31 名,是该榜单唯一的 AI 3D 公司,与 OpenAI、Anthropic、Canva、Superhuman、Higgsfield 等共同上榜。
Meshy 位列 a16z 首份消费级 AI 应用月收入榜单第 31 名,是该榜单唯一的 AI 3D 公司,与 OpenAI、Anthropic、Canva、Superhuman、Higgsfield 等共同上榜。
爱范儿作者张展毓体验 DLSS 5 正式版,发现它能在渲染末端用神经网络把《NBA 2K27》的皮肤、织物、地板和色彩修正到接近真实摄影质感。
研究者提出 DDT-RFE,移除 Decoupled Diffusion Transformer(DDT)编码器块中 Self-Attention 与 MLP 周围的残差连接,并将输入 patch embedding 与中间及最终编码器特征融合,使解码器获得多层信息。
研究提出 Diffusion On-Policy Context Distillation(D-OPCD),把智能体改进后的提示词作为特权上下文,将 agent harness 的能力蒸馏进扩散模型权重。
论文提出能量自适应噪声调度与白化策略,用于变换域扩散模型,将全局谱白化与按变换系数能量及图像相关能量路径联合调制的噪声分配结合。该方法保持高斯过渡与闭式边缘分布,兼容标准 DDPM 和 DDIM,无需修改扩散架构。CIFAR-10 实验将紧凑 DCTdiff U-Net 变体的 Fréchet Inception Distance 从 142.48 降至 100.45。
研究者提出 CHARTER,一种面向计算病理学的参考感知评估章程,要求研究者 DECLARE 预期目标与参考、QUANTIFY 候选引发的预测偏移、AUDIT 比较结论的稳定性。
该研究发布一个西方蓝鸟(Sialia Mexicana)检测与分割基准数据集,包含来自 41 次录制会话的 6,000 余张 4K 高分辨率野外标注图像,鸟体仅占画面很小比例。
论文提出高斯泼溅序列压缩方法 GSCV,用标准视频编解码器完成压缩。现有基于视频的方案依赖 Parallel Linear Assignment Sorting(PLAS)与跟踪原始信息,但跟踪信息在多数实际场景不可用,原始 PLAS 会因随机性产生帧间相关性弱的图像。
RefRoute 提出紧凑残差条件化与条件/注意力路由,降低多参考图像生成中参考表征与注意力开销,并在 16 个参考时让 50-step 与 4-step 配置分别取得 $18.3\times$ 和 $14.2\times$ 相对 FLUX 基线的加速。
研究扩展了人在回路框架,结合 5,901 个基础模型生成伪标签、860 个专家标注疑难病例与 198 个共识失败病例,系统评测九种细胞核分割模型配置下的七种微调策略。
提出 RBMatch,一个面向半监督建筑足迹提取的双层级类别重平衡框架,联合调控伪标签生成与无监督优化,以解决仅平衡伪标签选择时背景偏差在无监督损失优化中重现的“imbalance leak”问题。
论文提出 Dual-FDM,在频率感知扩散模型中解耦定制参考与色彩风格参考,以同时处理定制风格迁移和色彩风格迁移。方法在频域内用掩码策略解耦不同频段:定制风格迁移中用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移中用色彩参考的前景与背景低频段替换风格参考背景的低频段,替换后的频段作为键值重建去噪个性化图像的前景与背景。
研究者提出 REViT-v2,一种基于窗口化群卷积自注意力与分层特征架构的可扩展旋转群等变视觉 Transformer。该方法可扩展到参数量达数百万的群等变 ViT,并在 ImageNet 等实际尺寸的大规模数据集上验证。代码与预训练权重已开源,论文被 NeurIPS NeurREPS workshop 2026 接收。
CETUS 在 USGS 卡西尼号土卫六 SAR 镶嵌图上比较 DINOv2、DOFA、CROMA 与经典图像测量及未训练 vision transformer 特征,分类器依据专家地貌图学习地形标签并预测到地理分离区域。
SRIM 把照片缩放建模为频率选择信道,在多个锚点尺度上采样扰动并偏向当前最弱尺度,以应对未知缩放因子。在 9 至 30 兆像素照片、2 至 8 倍缩放下,SRIM 将 FLUX.2-klein 编辑的最坏破坏度从已发表最强防护的 0.192 LPIPS 提升到 0.463;同等可见度下防护约翻倍,并对 9B 模型、FLUX.2-dev 与 InstructPix2Pix 同样有效。
ElasticFit 是一个 VLM 引导的拟合感知 3D 物体插入框架,通过场景接地表示把语言指令与渲染观察转化为落点、占据体积、朝向与适配模式(刚性放置、均匀缩放或弹性拟合)等结构化约束,再生成场景条件物体先验、重建 3D 并按模式细化网格,强制碰撞规避、接触一致与物理接地。
WildMatch 提出一种仅用身份标签、无需关键点或几何对应标注的弱监督方法,对预训练关键点匹配器进行自适应。该方法用预训练匹配器挖掘信息量大的图像对,从身份一致性中导出弱正负监督,并对比微调匹配网络,强化同身份对应、抑制异身份对应。在开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。
SimCortex v2 提出一个深度学习框架,从 T1 加权 MRI 同时重建左右白质与软脑膜表面,用基于带状条件 U-Net 类网络预测的多尺度稳态速度场联合优化四个表面。
论文提出免训练框架 HGSS,用于文本到图像扩散模型的组合概念擦除,通过层次跨度定位与动态属性绑定消除目标概念且不更新模型权重、不增加学习参数。
研究者提出自监督框架 LAO-X,可在 X 光安检扫描中定位任意物体,全程无需人工标注。LAO-X 通过显著性引导的 X 光物体挖掘模块与物理引导合成生成多样图像—标注对,并用遮挡控制课程策略微调 Segment Anything Model 2(SAM2)定位器。在六个 X 光基准测试中,LAO-X 在重度杂乱场景下较 SAM2 及 X 光专用基线取得 2% 至 23% 的 mAP 提升。
论文提出混合跨模态注意力网络 HCMAN,用 transformer 跨模态注意力机制融合乳腺 X 光图像与结构化临床数据。模型基于埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张乳腺 X 光图像验证,准确率 97.8%、灵敏度 97.2%、特异性 98.3%、AUC 0.987,显著优于仅用图像的基线。
MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅输入两张图像即可在单次前向传播中预测像素对齐的高斯基元,无需逐场景优化即可渲染新视角。
研究揭示文本到图像模型的 VAE 潜空间存在与亮度和对抗色对齐的共享颜色子空间,并通过编码器线性近似与定向潜空间引导,在 SD1.5 到 FLUX.2 和 Z-Image 的多种 VAE 中一致验证。
一项面向巴基斯坦旁遮普的作物产量预测原型融合 Random Forest、XGBoost、支持向量回归与 Ridge 堆叠集成,并接入 MobileNetV2 叶片健康分类器,部署为带 SHAP 解释的 Web 应用。
Anchor and Adapt 是一个两阶段提示词学习框架,把异常语义获取与目标正常外观适配分离:第一阶段从带标注辅助数据学习可迁移的正常与异常锚点,第二阶段固定锚点,仅用少量目标正常样本适配额外的正常分支。
论文提出通用少样本类增量学习(G-FSCIL)设定,基础会话本身仅含少量类别,解决基类与增量数据同时稀缺导致的表征薄弱与语义漂移问题。方法用冻结的扩散模型构建类特定合成候选池,在首次观测时执行类反转并复用条件嵌入按需生成,再学习知识筛选策略选出兼具语义一致性与视觉多样性的样本,并蒸馏为可迁移的选择策略。
DistScene 提出单图组合式 3D 场景生成框架,联合建模环境与单个物体,将环境作为显式场景组件为物体放置提供几何上下文。方法包括 Scene-Frame Generation、Object-Centric Refinement 与 Object-to-Scene Distillation,后者通过自动合成并渲染的场景把预训练物体生成先验迁移到场景生成。
研究提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)把概念遍历建模为穿过中间状态的曲线,以一维坐标及其学习函数定义轨迹,使引导方向随概念变化且保持可解释。
研究者提出 UniPro,用传播机制把 2D 分割扩展到 3D 体数据,统一语义、上下文、交互和传播四种分割模式。模型以类别先验、参考样本、用户点击和相邻切片预测作为条件输入,并引入双向与 3D 监督提升传播可靠性。实验显示其在多模态、多解剖结构上表现稳健,可从稀疏 2D 初始化实现标注高效的 3D 分割,减少逐切片校正工作量。
论文研究高斯分布间 FID 估计的样本复杂度,给出经验 plug-in 估计器 Θ(d²/n) 偏差与 Θ(d/n + d²/n²) 方差界,证明其样本复杂度下界为 ≳ d²。
论文提出特征信息动力学(feature information dynamics),一个基于信息论的框架,用于定位扩散模型生成过程中特征出现的时刻。研究用 I-MMSE 恒等式把特征互信息变化率与无条件与特征条件去噪损失之差相连,给出特征信息密度的实用估计量,并发展链式分解区分特征层级中的共享与增量信息。
前 Ramp 工程师创办的 AI 广告平台 Melius 完成 2500 万美元融资,含 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月的 Nano Banana 2,并称在视觉质量、文字渲染、对话轮次角色一致性、全景图和信息图上均有改进。
Google Photos 与 Gallery 可共存于同一手机,无需二选一;核心差异在于 Photos 支持自动云备份,Gallery 则没有。Google One 订阅 100GB 为每月 $2、200GB 为每月 $3,2026 年 3 月 9 日及之后创建的新账号默认仅 5GB 免费空间。
Gamma 推出重建版平台 Gamma 5,通过全新编辑器、更强的 AI 智能体和扩展至数千套的视觉模板库,减少 AI 演示文稿常见的版式重复与“AI 味”。平台整合 20 余个 AI 模型(含 Anthropic、OpenAI、Google)及多个图像生成器,智能体可在沙箱中生成图像、操作文件、联网检索并自检输出。
印尼青少年Noxa用OpenAI图像生成工具创作的Tung Tung Tung Sahur爆红后,围绕其版权归属在美国加州北区法院引发诉讼。Do Big起诉代表Noxa的法国机构Mementum,主张AI生成内容不构成人类创作,而Mementum已依据欧盟《数字服务法》成功下架并反诉商标侵权。
Pinterest 推出新功能 Beauty Guides,借助其视觉智能与生成式 AI 技术 Pinterest Intelligence,把用户保存的美妆类 Pin 转化为可带到沙龙的行动方案。
Gamma 推出重构版演示平台 Gamma 5,新编辑器、AI 智能体和视觉样式库支持智能体在沙箱中生成图像、操作文件、联网检索并自查输出,模板库扩至数千套。平台整合 20 余个 AI 模型(含 Anthropic、OpenAI、Google)及约 20 个连接器,导入材料的视觉准确率基准从约 30% 升至 97% 以上。
Sony 宣布 Quick Spectral Super Resolution(QSSR),把 AI 辅助图形升频带到标准版 PS5,无需 PS5 Pro。
OpenAI 推出视觉展示广告,将出现在用户请求 ChatGPT 生成图像的旁边,新广告本月晚些时候率先在美国上线,面向首批测试广告主,并会明确标注且不影响 ChatGPT 的回答。