AI Radar 简报 · 2026-08-14
涵盖 AI精选 · 热点动态 · AI简报 · 论文速递
🔥 AI精选
来源:AIHOT · 精选热点
| 日期 | 标题 | 来源 | 分类 |
|---|---|---|---|
| 08-14 | GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力 | 公众号:智谱(GLM) | 模型 |
| 08-14 | DeepSeek V4 Pro 登陆硅基流动,提供 1M 上下文三档推理 | X:硅基流动 SiliconFlow | 模型 |
| 08-14 | 蚂蚁百灵与 ASystem 打通单机 Agentic RL 后训练闭环 | 公众号:蚂蚁百灵(Ling) | 技巧 |
| 08-14 | 从 0 到 1 带你速通 DeepSeek Harness | 公众号:数字生命卡兹克 | 技巧 |
| 08-14 | Claude 接管应用日常维护:数周内自动开出 388 个 PR | X:Boris Cherny | 技巧 |
| 08-14 | Google DeepMind 推出 Gemini 3.7 Flash:距 3.6 仅三周,价格减半 | Google DeepMind Blog | 模型 |
| 08-14 | MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型 | MiniMax Blog | 模型 |
| 08-14 | Google Sheets 推出 Sheets canvas:用 Gemini 将表格数据变为交互式迷你应用 | Google Blog:AI | 产品 |
| 08-14 | Qwen3.8-2.4T-A95B 开源,硅基流动 Day-0 上线 | X:硅基流动 SiliconFlow | 产品 |
| 08-14 | DeepSeek Harness v0.1 开发者预览版发布,MIT 开源 | X:DeepSeek | 产品 |
📡 热点动态
来源:AIHOT · 全量热点(近 1 天)
-
08-14 GLM-5.3 发布:网络安全能力大幅跃升 —
X:Kim
GLM-5.3 基座与 5.2 相同,提升完全来自扩展后训练:Terminal-Bench 3.0 得分从 4.6 升至 28.3,CyberGym 从 77.2% 升至 84.5%,ExploitBench 从 24.4% 升至 54.4%——网络安全能力成为新一代模型后训练 Scaling 的标志性涌现方向。 -
08-14 MiniMax-Music3 音乐模型发布:AI 生成最长 5 分钟歌曲 —
IT之家
分层自回归架构,Global LLM(Qwen3-8B 初始化)+ 0.6B Local LLM,32kHz/16-bit 输出,可根据歌词与音乐描述生成完整歌曲——音乐生成从”片段级”迈向”完整作品级”,开源权重降低专业生产门槛。 -
08-14 DeepSeek Harness 实测:灵活切换多模型,支持视觉接入 —
X:X.PIN
实测比预期更灵活:可在多模型间即时切换、连接视觉模型;团队目标是”时间性与空间性可组合”——工具可动态安装、调整、移除,比 Claude Code 更近一步的开放架构。 -
08-14 高盛:AI 不太可能在印度引发大规模失业,未来 10 年生产率提升 0.4% —
IT之家
建筑业和零售贸易吸纳印度约 40% 劳动力、基本未受 AI 影响;岗位替代风险主要集中在邮政、电信和 IT 服务——AI 的就业冲击在不同经济结构下分化明显。 -
08-14 Phone Harness 实机教程:让 Codex/Claude Code 无需越狱控制锁屏 iPhone —
X:阿易 AI Notes
合盖睡觉时 Agent 自主完成开 APP、点按钮、读屏幕等操作;教程覆盖本地安装、权限避坑和云端异步任务设置——手机端 Agent 操控进入”人睡机器跑”的新阶段。 -
08-14 百度文库网盘 GenFlow 官宣中文名”库库 AI”,月活已破 1 亿 —
IT之家
GenFlow 4 月 MAU 突破 1 亿,AI 办公 MAU 超 2500 万;推出独立端(PC/网页/小程序/企业版),可并行调用 Office Agent——国产 AI 办公工具进入规模化阶段。 -
08-14 马斯克演示如何用 @bot 构建 AI 幕僚长:一条指令管理整个机器人团队 —
X:Elon Musk
用自然语言指令让 @bot 扫描个人信息、发现现有机器人并形成”团队”、持续优化协作方式——xAI 将 @bot 定位为多 Agent 协调的中枢入口。 -
08-14 中芯国际 AI 相关芯片产能告急,Q3 实施新定价 —
X:X.PIN
Q2 营收突破 30 亿美元,晶圆出货量环比增 14.4%,平均售价上涨 5.7%,产能利用率约 95%;AI 逻辑、BCD 和光模块芯片仍供不应求——中国 AI 基础设施投资全面拉动本土芯片产能。 -
08-14 LG 与 NVIDIA 签署谅解备忘录:2027Q1 展示双足人形机器人,2028H1 建成 80MW AI 工厂 —
IT之家
人形机器人基于 Jetson Thor 芯片,AI 工厂规模 80MW——LG 从家电向 AI 硬件基础设施的战略转型进入执行阶段。 -
08-14 GLM-5.3:具备新兴网络攻防能力的前沿编码模型 —
Hacker News
Hacker News 热议:智谱 GLM-5.3 编码基准领先,同时展现出此前未明确声明的网络安全特性——前沿模型在网络安全方向的涌现能力正引发社区关注。 -
08-14 Meet Needle 2:45M 参数工具调用模型,14MB 二进制,28MB RAM 可跑完整会话 —
MarkTechPost
Cactus Compute 发布超轻量工具调用模型——Agent 能力向极限资源受限设备下沉,14MB 二进制意味着可内嵌几乎任何硬件。 -
08-14 GLM-5.3 登陆 Go,1M 上下文与 GLM-5.2 同价 —
X:opencode
GLM-5.3 以与前代相同定价提供 1M 上下文、文本支持——国产编程模型通过定价平移加速用户迁移到新版本。 -
08-14 模型极速时代:不再需要任务切换,直接持续向模型反馈 —
X:Gabriel
“当模型足够快,只需不停唠叨反馈,去冰箱拿东西回来任务就完成了”——超快推理速度正在改变人与 AI 的协作节奏,任务切换开销趋近于零。 -
08-14 GLM-5.3 发布,再迭代两版或全面超越头部模型 —
X:小北
博主观察:按此迭代速度,智谱”再两个版本”即可全面超越——中国开源模型与闭源顶级的差距正在以月为单位缩短。 -
08-14 Grok 4.6 胜出:用户认为 ChatGPT 表现落后 —
X:cb_doge
社区对比中 Grok 4.6 获更高评价,ChatGPT 被批”太蠢”——模型能力感知差距正在影响用户留存与口碑,各厂商的迭代压力进一步加大。
📋 AI简报
来源:AI Digest
2026-08-14
-
Flock 强制警方搜索填写案号并接受自动审计,回应车牌监控滥用争议 — Flock 运营约 12 万台车牌读取摄像头,《华盛顿邮报》发现 46 起未授权滥用案例。争议导致合同流失后,Flock 将两项可选护栏改为强制:搜索前必须填写刑事案号,自动审计系统也将强制开启标记异常操作。但执法外的私人调查员仍可使用、案号无法核验真实性——技术企业在公众压力下修补护栏,仍难覆盖制度性漏洞。
-
Google 发布 Gemini 3.7 Flash:三周再迭代,年内价格降至 3.6 Flash 原价一半 — 面向编码和 Agent 工作流,FrontierCode 1.1 Main 得分从 3.6 Flash 的 34.4% 升至 43.6%,DeepSWE v1.1 为 65.3% 对 49.0%。输入/输出定价分别为 $0.75/$3.75 每百万 token,为前代价格的一半。未公布具体基准方法论——快速迭代+持续降价,Google 在工作流模型层面保持高压节奏。
-
CGTrader:AI 生成 3D 模型占近期上传量六分之一,却只贡献平台九十分之一收入 — 基于 2025 年 6 月至 2026 年 5 月平台数据:买家把质量而非价格列为首要购买因素,购买过 AI 生成资产的用户中仅 5% 认为表现良好、20% 认为质量不够好。3D 打印场景中质量缺陷风险更直接——AI 生成内容”供给爆炸、变现极难”的困局在 3D 资产市场已有实证。
📄 论文速递
来源:AI Brief
重点关注
Agent:用户沉默之后,个人 Agent 才真正开始接受考验
订行程、管账单或协调家庭事务时,用户不会每天提醒 Agent 下一步该做什么,但任务仍要在不断变化的环境里持续推进。VibeLifeBench 把这种现实压缩成 200 个跨越数周的任务,覆盖 10 类生活场景和 22 个模拟服务;世界会自行运转,一些变化不会主动通知,Agent 必须重新检查环境,判断何时行动、询问或保持沉默。它测量的也不只是最终有没有完成任务,而是通过细粒度加权检查,同时评估结果状态与行动时机——当前最佳模型得分约 36%,距离”可靠的个人 Agent”仍有很大空间。
先生成 RGB 视频、再交给另一套模型补做三维重建,会把分布错位和逐级误差一起带进 4D 场景。作者尝试绕过 RGB,直接将视频模型去噪后的潜变量对齐到预训练 4D 解码器,让视频先验成为动态几何的结构约束。更有意思的是,这个接口仅用约 1000 段现有重建视频训练,同一检查点便能迁移到共享 VAE 的多个视频扩散模型,无需随生成器重新训练。对要做动态 3D/4D 内容的团队:先问生成器的输出格式能不能直接对接几何解码,比串联两套模型更有效。
直觉上持续预训练应该重塑模型权重,但这项研究发现,适配数学、代码或指令领域后,权重的奇异值谱基本不变,主要变化反而出现在奇异向量上。更实用的发现来自注意力头:移除最多 60% 的低重要性头更新也没有可测量的质量损失,将其回退到预训练状态时基准准确率甚至最高提升 4%。启示:持续预训练时不必对所有权重一视同仁,识别哪些注意力头的更新值得保留,可能比盲目训练更高效。
也值得关注
- SPIEval:跨应用个人信息检索与指令执行基准 — 移动助手的难点不只是检索个人信息,而是跨应用拼接零散证据后仍能正确执行用户指令。
- Flow Straight to Reality:感知一致性流匹配图像复原 — 把感知一致性直接写进流匹配路径,尝试在更少采样开销下兼顾复原精度与视觉真实感。
- UniProbe:token 级视觉幻觉检测器 — 利用图像 patch、查询 token 与生成 token 的多结构计算轨迹,定位哪些生成 token 缺乏图像证据,比整段拒绝或重生成更精准。
- Every Packet Counts:抗丢包学习式图像压缩 — 面向卫星和应急链路,让信息在数据包间更均匀分散,避免少量丢包摧毁整幅图像。
- DSAR:写实且时间连贯的可动画数字人 — 双流自回归建模分别传播上一帧表面位移,融合历史隐状态以改善分布外动作中的衣物动态。
- 二阶纹理理论:用于焦点测深 — 波动光学表明传统视觉眼中的”无纹理表面”也可能携带可用于被动测深的二阶纹理信号。
- 灰度图与全色图像上色新方法 — 放开亮度重建比单纯预测色度更适合历史影像上色场景。
- HNDiff:以雾—噪声扩散建模图像去雾 — 去雾扩散不再从纯高斯噪声凭空恢复,而是把雾形成过程转化为更贴近退化物理的起点。