AI 简报 · 2026-08-14

AI Radar 简报 · 2026-08-14

涵盖 AI精选 · 热点动态 · AI简报 · 论文速递


🔥 AI精选

来源:AIHOT · 精选热点

日期 标题 来源 分类
08-14 GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力 公众号:智谱(GLM) 模型
08-14 DeepSeek V4 Pro 登陆硅基流动,提供 1M 上下文三档推理 X:硅基流动 SiliconFlow 模型
08-14 蚂蚁百灵与 ASystem 打通单机 Agentic RL 后训练闭环 公众号:蚂蚁百灵(Ling) 技巧
08-14 从 0 到 1 带你速通 DeepSeek Harness 公众号:数字生命卡兹克 技巧
08-14 Claude 接管应用日常维护:数周内自动开出 388 个 PR X:Boris Cherny 技巧
08-14 Google DeepMind 推出 Gemini 3.7 Flash:距 3.6 仅三周,价格减半 Google DeepMind Blog 模型
08-14 MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型 MiniMax Blog 模型
08-14 Google Sheets 推出 Sheets canvas:用 Gemini 将表格数据变为交互式迷你应用 Google Blog:AI 产品
08-14 Qwen3.8-2.4T-A95B 开源,硅基流动 Day-0 上线 X:硅基流动 SiliconFlow 产品
08-14 DeepSeek Harness v0.1 开发者预览版发布,MIT 开源 X:DeepSeek 产品

📡 热点动态

来源:AIHOT · 全量热点(近 1 天)


📋 AI简报

来源:AI Digest

2026-08-14


📄 论文速递

来源:AI Brief

重点关注

Agent:用户沉默之后,个人 Agent 才真正开始接受考验

订行程、管账单或协调家庭事务时,用户不会每天提醒 Agent 下一步该做什么,但任务仍要在不断变化的环境里持续推进。VibeLifeBench 把这种现实压缩成 200 个跨越数周的任务,覆盖 10 类生活场景和 22 个模拟服务;世界会自行运转,一些变化不会主动通知,Agent 必须重新检查环境,判断何时行动、询问或保持沉默。它测量的也不只是最终有没有完成任务,而是通过细粒度加权检查,同时评估结果状态与行动时机——当前最佳模型得分约 36%,距离”可靠的个人 Agent”仍有很大空间。

视频生成:动态世界没必要先被压成一段视频

先生成 RGB 视频、再交给另一套模型补做三维重建,会把分布错位和逐级误差一起带进 4D 场景。作者尝试绕过 RGB,直接将视频模型去噪后的潜变量对齐到预训练 4D 解码器,让视频先验成为动态几何的结构约束。更有意思的是,这个接口仅用约 1000 段现有重建视频训练,同一检查点便能迁移到共享 VAE 的多个视频扩散模型,无需随生成器重新训练。对要做动态 3D/4D 内容的团队:先问生成器的输出格式能不能直接对接几何解码,比串联两套模型更有效。

训练优化:模型学会代码,权重的「强弱排序」却几乎没变?

直觉上持续预训练应该重塑模型权重,但这项研究发现,适配数学、代码或指令领域后,权重的奇异值谱基本不变,主要变化反而出现在奇异向量上。更实用的发现来自注意力头:移除最多 60% 的低重要性头更新也没有可测量的质量损失,将其回退到预训练状态时基准准确率甚至最高提升 4%。启示:持续预训练时不必对所有权重一视同仁,识别哪些注意力头的更新值得保留,可能比盲目训练更高效。

也值得关注


Leave a Comment