AI Radar 简报 · 2026-07-03
涵盖 论文速递
📄 论文速递
来源:AI Brief
重点关注
Agents-A1:参数只有 35B(MoE),通过横向扩展 agent horizon 而非堆大模型达到万亿参数级表现。核心是搭一套长程”知识-动作-观察-验证”基础设施,产出平均 45K token 的 agentic 轨迹,再用三阶段配方(全域 SFT → 分域 teacher → 多 teacher on-policy 蒸馏)统一六个异构领域进一个 student。SEAL-0(56.4)、IFBench(80.6)领先 Kimi-K2.6、DeepSeek-V4-pro 等 1T 模型。真正的信号:对养不起前沿模型的团队,投资建长程轨迹基础设施可能比继续堆参数更划算。(注:SciCode、HLE、BrowseComp 上只是”competitive”,需自行对榜核实。)
Orca:用 Next-State-Prediction(预测下一个世界状态)替代各自为战的 next-token/next-frame/next-action,把”理解、预测、行动”塞进统一 world latent space。数据规模:12.5 万小时视频 + 1.6 亿事件标注,冻结主干只训轻量解码器同时做文本/图像/具身动作。一天 194 个 upvote。注意:作者自己写了”initial instantiation”并专门讨论局限——愿景很大,落地很早。关键信号是最弱任务的数字和 latent 能否随规模变强。
业界普遍认为异步流水线的梯度滞后会破坏训练稳定性,这篇发现这取决于优化器而非异步本身的原罪——AdamW 会明显退化,但较新的 Muon 对 one-step 延迟表现出很强的鲁棒性。加上受 Error Feedback 启发的通用修正项,在最大 10B 参数模型上把异步和同步的性能差距基本抹平。对从事大规模训练基础设施的团队有直接参考价值。
BeyondArena:覆盖时序、分组等非 IID 场景及带文本/高基数特征的真实数据,跑 11 个模型 × 142 个数据集。结论:TFM 只在小到中等规模的 IID 数据上领先,数据变大、高维或分布偏移时,传统树模型和深度学习重新占上风。“基础模型”这个名号目前更多是营销而非能力描述——在把它塞进真实表格业务前,先确认数据长得像不像它的舒适区。
Flux-GS:移动端部署 3D Gaussian Splatting 的真正瓶颈是高阶球谐函数(SH)的推理和存储开销,而非画质。用蒙特卡洛采样将三阶 SH 高光能量聚合进紧凑低阶表示,避开蒸馏或预训练;补偏移量模块找回高频细节、剪冗余高斯点防止过拟合。定位清楚:给 AR/端侧 3D/实时新视角合成提供降本路线。
也值得关注
- 给 agent 的每一次工具调用做信用分配 — TACO:结果奖励分不清工具用得有用/冗余/误导,无需外部裁判把功劳/责任落到单次调用
- 刻意走前沿世界模拟器的反面 — 消费级 GPU、实时、可键盘交互的低算力可控 world model——能玩起来比参数大更重要
- 给 masked discrete diffusion 补上”自我纠错”能力 — 离散 token 一旦 unmask 就改不了的老问题,是高分辨率文生图的关键短板
- 在无害数据上做 benign 微调,会悄悄把先前训好的对齐遗忘掉的能力反弹回来 — 给”训练后脆弱性”提了统一解释,安全对齐研究的重要发现
- RAG 对每个 query 固定取 N 篇既浪费又有害 — 把取多少篇做成按 query 校准的预算分配,reader 已经会的就少取甚至不取