AI 简报 · 2026-08-13

AI Radar 简报 · 2026-08-13

涵盖 AI精选 · 热点动态 · AI简报 · 论文速递


🔥 AI精选

来源:AIHOT · 精选热点

日期 标题 来源 分类
08-13 阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文 IT之家 模型
08-13 微软首发自研推理模型 MAI-Thinking-1 X: Mustafa Suleyman 模型
08-13 DeepSeek V4 Pro 与 Grok 4.6 同日发布,双双逼近 Claude Fable 5 体验 公众号: 数字生命卡兹克 观点
08-13 Anthropic 研究:新兴多智能体系统的模式与问题 Anthropic Research 研究
08-13 Claude in Chrome 侧边栏升级为 Claude Cowork 会话 Claude Blog 产品
08-13 WorkBuddy 上线远程控制,国内也有了最丝滑的 Agent 工作方式 公众号: 数字生命卡兹克 产品
08-13 空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈 Google Research 研究
08-13 AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求 GitHub Blog 技巧
08-13 Meta 开源 Muse Glimmer 登陆 OpenRouter X: OpenRouter 产品
08-13 我写了一本 AI 教科书——AI 还要多久才能写得更好? Interconnects 观点

📡 热点动态

来源:AIHOT · 全量热点(近 1 天)


📋 AI简报

来源:AI Digest

2026-08-13

  • Twitch 默认允许亚马逊用直播内容训练生成式 AI,主播须主动退出 — Twitch 新增生成式 AI 训练设置,确认主播频道内容(直播、VOD、剪辑、直播聊天及频道图片文字)可用于训练亚马逊模型,且所有用户默认同意——没留意公告或没改设置的主播会持续供给内容。退出需进账户安全设置底部关闭对应开关,但 Twitch 未说明此前已用多少内容、历史数据能否删除。退出只针对生成式训练,不停止 AutoMod 等社区安全功能——平台用”默认加入+主动退出”的方式最大化训练数据获取,引发内容创作者数据权利争议。

  • Google 将美国手语输入带到 Pixel 11,首批接入 Gboard 和 Live Transcribe — Google DeepMind 与 Android 团队发布 SL2T 1.0,将美国手语输入从研究项目带入手机产品,Pixel 11 用户可在 Gboard 和 Live Transcribe 中免费率先使用。项目由聋人 Google 员工 Sam Sepah 提出,聋人合作伙伴深度参与数据收集、评估与影响评估,并成立 AI 手语咨询委员会——AI 无障碍能力落地到主流消费产品,展示了 AI 服务边缘群体的实际价值。

  • Google 披露 Gemini 使用画像:月活破 10 亿,63% 活跃用户使用语音 — Gemini 成为 Google 增长最快的产品,月活达 10 亿。负责人称 63% 活跃用户使用语音输入、纯语音用户在增加;Gemini Live 用户中 20% 会共享摄像头画面或屏幕请 AI 根据实时视觉提供帮助;学校相关请求 38% 含附件;用户每天借助 Google AI 生成 1.5 亿张图片——语音和实时视觉正成为主流交互方式,AI 助手的使用形态从”打字问答”快速多模态化。


📄 论文速递

来源:AI Brief

重点关注

把视频模型留在训练场,自动驾驶推理反而更轻

训练时借视频生成学习世界如何变化,推理时却把视频分支整个拿掉——SimWAM 让预训练视频专家与轻量动作专家联合训练,用隔离注意力保证轨迹预测不依赖未来画面,部署时只保留能直接输出轨迹的动作分支。两个专家不共享参数、只通过统一注意力接口交互,因此视频骨干可替换、动作分支可独立扩展。配合 RL 优化组合式驾驶奖励,在 NAVSIM 达 91.5 PDMS,以显著更低延迟超过此前世界-动作规划器,并零样本迁移到 nuScenes。实用路线:把生成模型当训练期教师,吸收动态规律后不再为其长期推理成本买单。

适配器插错位置,微调可能比全量训练更差

通用 PEFT 在实时检测器上会静默失效:流程照常运行,但异构算子、检测头语义和部署约束可能让适配器放错位置。YOLO-PEFT 把模块选择改造成可审计的约束规划,为每个被排除模块记录原因、方案不可靠时拒绝训练。按 VOC07+12 协议,规划出的 RS-LoRA 在 YOLO11s/12s 上达 0.7138/0.7307 mAP50-95,高于全量微调;到 RT-DETR-L 时 7 种 LoRA 配置全部越过灾难阈值,系统建议回退全量微调——”知道何时不用 PEFT”同样有工程价值。代价:LoRA 峰值显存减 43.9%,但训练时间增至 1.72 倍。

深伪检测漏掉的,可能不是模型能力而是取证视角

把所有伪造线索一次压成真假结论,可能正是深伪检测难以泛化的原因。这项工作让四个取证角色分别检查纹理、光照、运动和物理一致性,再由裁判汇总证据并解释;关键不在 Agent 数量,而在不同线索能否保持相对独立。配套数据集含 10 万段视频、覆盖 33 种换脸与人脸生成方法。这套完全由小型开源多模态模型组成的框架,在域外测试中超过 GPT 和 Gemini 等闭源模型,并在该基准全部指标上排名第一。真正的考验仍是面对训练/评测未覆盖的新合成方法时分工取证能否继续有效。

也值得关注


Leave a Comment