AI 简报 · 2026-07-03

AI Radar 简报 · 2026-07-03

涵盖 论文速递


📄 论文速递

来源:AI Brief

重点关注

35B 想摸到万亿参数的表现,赌的是横向而非纵向

Agents-A1:参数只有 35B(MoE),通过横向扩展 agent horizon 而非堆大模型达到万亿参数级表现。核心是搭一套长程”知识-动作-观察-验证”基础设施,产出平均 45K token 的 agentic 轨迹,再用三阶段配方(全域 SFT → 分域 teacher → 多 teacher on-policy 蒸馏)统一六个异构领域进一个 student。SEAL-0(56.4)、IFBench(80.6)领先 Kimi-K2.6、DeepSeek-V4-pro 等 1T 模型。真正的信号:对养不起前沿模型的团队,投资建长程轨迹基础设施可能比继续堆参数更划算。(注:SciCode、HLE、BrowseComp 上只是”competitive”,需自行对榜核实。)

194 个赞投给的是方向,还是一份还没落地的路线图?

Orca:用 Next-State-Prediction(预测下一个世界状态)替代各自为战的 next-token/next-frame/next-action,把”理解、预测、行动”塞进统一 world latent space。数据规模:12.5 万小时视频 + 1.6 亿事件标注,冻结主干只训轻量解码器同时做文本/图像/具身动作。一天 194 个 upvote。注意:作者自己写了”initial instantiation”并专门讨论局限——愿景很大,落地很早。关键信号是最弱任务的数字和 latent 能否随规模变强。

异步流水线的”代价”,可能被高估了

业界普遍认为异步流水线的梯度滞后会破坏训练稳定性,这篇发现这取决于优化器而非异步本身的原罪——AdamW 会明显退化,但较新的 Muon 对 one-step 延迟表现出很强的鲁棒性。加上受 Error Feedback 启发的通用修正项,在最大 10B 参数模型上把异步和同步的性能差距基本抹平。对从事大规模训练基础设施的团队有直接参考价值。

表格基础模型的”通用”,只在舒适区里成立

BeyondArena:覆盖时序、分组等非 IID 场景及带文本/高基数特征的真实数据,跑 11 个模型 × 142 个数据集。结论:TFM 只在小到中等规模的 IID 数据上领先,数据变大、高维或分布偏移时,传统树模型和深度学习重新占上风。“基础模型”这个名号目前更多是营销而非能力描述——在把它塞进真实表格业务前,先确认数据长得像不像它的舒适区。

3D 高斯的画质早就够了,卡住移动端的其实是这个

Flux-GS:移动端部署 3D Gaussian Splatting 的真正瓶颈是高阶球谐函数(SH)的推理和存储开销,而非画质。用蒙特卡洛采样将三阶 SH 高光能量聚合进紧凑低阶表示,避开蒸馏或预训练;补偏移量模块找回高频细节、剪冗余高斯点防止过拟合。定位清楚:给 AR/端侧 3D/实时新视角合成提供降本路线。

也值得关注


Leave a Comment