AI Radar 简报 · 2026-07-20
涵盖 AI精选 · 热点动态 · 论文速递
🔥 AI精选
来源:AIHOT · 精选热点
| 日期 | 标题 | 来源 | 分类 |
|---|---|---|---|
| 07-20 | Qwen 3.8 发布:2.4 万亿参数,”仅次于 Fable 5″,Qwen3.8-Max-Preview 已上线 Token Plan/Qoder,权重即将开源 | X: 通义千问 | 模型 |
| 07-20 | 黄仁勋访日:为日本建 Vera Rubin AI 工厂(13750 颗 CPU + 27500 颗 GPU,2028 年投运),布局物理 AI 时代主权算力 | TechCrunch | 行业 |
| 07-20 | Ollama 获 8800 万美元融资:890 万开发者,85% 的财富 500 强企业使用,云端 Token 用量月均翻倍 | Hacker News | 行业 |
| 07-20 | 字节跳动发布 Seed Audio 1.0:统一建模人声/音效/环境声,100ms 精度时间控制,20+ 语种,多数场景音频可用率 90%+ | 字节 Seed | 模型 |
| 07-20 | 面壁智能发布 MiniCPM5-2B:4B 以下全球 AA-Index 第一,原生混合思考 + 512K 上下文,适配华为昇腾等 9 款芯片,即将开源 | 公众号: 面壁智能 | 模型 |
| 07-20 | 面壁智能发布首个具身智能成果 MiniCPM-Robot:含 1.5B VLA 与 0.9B 移动跟踪模型,联合 OpenBMB 开源 | 公众号: 面壁智能 | 模型 |
| 07-20 | 昆仑万维宣布 2026 为”世界模型元年”:发布 Matrix-Game 3.5(720p 单卡 20FPS)、Mureka v9.5 与 O3 音乐模型,核心架构开源 | 公众号: 昆仑万维 | 模型 |
| 07-20 | 零代码 Vibe Coding 完整教程:用国产大模型(Kimi/GLM/Qwen)从零开发上线产品,含 ICP 备案/分支保护/测试全流程 | 公众号: 数字生命卡兹克 | 技巧 |
📡 热点动态
来源:AIHOT · 全量热点(近 1 天)
-
07-20 月之暗面提交港股上市申请,预计六个月内完成:Kimi K3 发布前后 ARR 三个月增长三倍,暂停新用户订阅优先保障现有用户算力 —
X: X.PIN
估值已突破 1 万亿港元;Kimi Code 计划与核心服务分开订阅——Kimi K3 驱动的商业化加速使 IPO 时机提前。 -
07-20 Hugging Face 遭完全自主 AI 智能体发动网络攻击:利用数据处理流水线两处代码执行漏洞,横向渗透多个内部集群,少量凭证泄露 —
IT之家
攻击者留下 17000+ 条动作日志,调查时自用 Agent 被付费模型当攻击者拦截,最终靠开源模型 GLM 5.2 完成取证——全球首例有据可查的完全自主 AI Agent 实施的真实网络入侵。 -
07-20 OpenAI 战略未来主管批 Kimi K3 开源属”减速主义”:会阻碍 AI 资本支出,并建议美国政府制造监管恐慌打压对手 —
IT之家
把开源等同于阻碍资本支出、建议借监管打压竞争对手——这一立场在 AI 社区引发强烈反弹,”减速主义”标签被认为是混淆开源与安全议题。 -
07-20 工信部:中国 AI 开源大模型全球累计下载量突破 100 亿次;国家级 AI 开源社区汇聚用户 1100 万+,托管模型超 7 万个 —
IT之家
开源鸿蒙生态设备超 13.5 亿台——中国开源模型生态在规模上已不可忽视,下载量数据反映全球开发者对国产开源模型的实际采用。 -
07-20 Kimi K3 修复 15 个 Codex 和 Claude Fable 5 拒绝修复的安全漏洞:10 小时,一个提示词,250 美元 —
X: Rohan Paul
安全场景下的”拒绝策略”差异成为模型选型的新维度——不同模型对高风险代码操作的默认态度存在实质差异。 -
07-20 Kimi K3 上线硅基流动,开发者已用其制作 FIFA 世界杯 26 复古点球大战游戏:8-bit 音效,44120 个 token —
X: 硅基流动
开源生态的快速扩散——Kimi K3 上线第三方推理平台后,开发者创意使用案例在 24 小时内涌现。 -
07-20 欧莱雅中国与火山引擎战略合作:豆包大模型进入 AIGC 素材生成/智能客服/智能助播/内容审核四大电商场景 —
公众号: 火山引擎
头部消费品牌+国产大模型平台的垂直合作案例,美妆电商成为生成式 AI 落地最密集的快消场景之一。 -
07-20 AI 让学术研究从”计算复杂度”回归”新洞察”:Gita Gopinath 观察 NBER 会议,主要依赖计算复杂度的研究溢价已大幅下降 —
X: Ethan Mollick
学术重心正摆回”新洞察、新机制、新测量”——AI 工具压低了计算壁垒,创新价值从技术难度转向问题选择和洞察深度。 -
07-20 AI 时代”先做垃圾”建议已过时:AI 将执行力拉满导致 AI Slop 泛滥,当下更需要的是多思考而非快产出 —
X: Oran Ge
AI 工具彻底改变了”执行力”的稀缺性——过去推动行动的建议,现在反而在制造噪音,”思考质量”成为新的竞争维度。 -
07-20 Seed Audio 1.0 正式开放 API:精准控时(100ms 间隔)+ 多语种生成,已上线火山方舟体验中心 —
公众号: 火山引擎
从研究发布到 API 商业化在同周完成——字节跳动音频 AI 的产品化节奏在加快。 -
07-20 腾讯 Hy-Embodied-VLM-1.0(A3B 模型)已开源,具身 VLM 基座进入开发者生态 —
IT之家
高效具身基础模型的开源加速行业基础能力共建,减少各团队从头训练基座的重复投入。 -
07-20 AI 婚礼短片:新郎朋友用 AI 生成复古质感短片,将两人从初识到相爱的故事跨越时代影像化,结尾停在真实相遇的一幕 —
X: 阿易 AI Notes
“技术本身没有温度,是用它装下爱意的人赋予了温度”——AI 创作工具进入高度个人化的情感表达场景。 -
07-20 Matrix-Game 3.5 架构核心开源:5B 模型 720p 单卡 20FPS,Patch 级记忆注入,支持可控世界生成 —
公众号: 昆仑万维
昆仑万维押注”世界模型元年”叙事,矩阵游戏世界模型开源是在争夺具身 AI 基础模型生态的话语权。 -
07-20 MiniCPM-Robot 开源:1.5B VLA 通用机械臂操控 + 0.9B 移动跟踪,面向端侧具身 AI 部署 —
公众号: 面壁智能
小参数量具身模型进入开源生态,降低机器人开发者上手门槛;面壁智能同日双发两款端侧模型(MiniCPM5-2B + Robot 系列),产品节奏密集。 -
07-20 Qwen 3.8 若真超 GPT 5.6,中美模型差距或已缩短至 3 个月——社区实测热情高涨 —
X: Oran Ge
阿里巴巴 2.4T 参数模型上线即引发”差距”讨论热潮,中国大模型追赶速度正在成为不可回避的行业叙事。
📋 AI简报
来源:AI Digest
今日无推送数据。
📄 论文速递
来源:AI Brief
重点关注
这个 teacher 不比 student 强,它只是知道结局
SEED:RL 的结果奖励只在轨迹末尾给一次分,中间几十步全靠一个标量往回摊——SEED 补的就是这段监督空白。关键设计:teacher 不是另一个更大的模型,而是同一个策略模型读完自己刚跑完的轨迹后,用自然语言写出可复用的”技能”(起决定作用的观察、该避开的失败模式)。同一批动作在”带技能”和”不带技能”两种上下文下各被打一次分,差值构成逐 token 的监督信号,与结果奖励联合优化。teacher 的优势不在能力,在信息——它有后见之明。收益边界:失败是”当时没意识到该这么做”时效果最好,若失败根本是能力缺失,自我分析也帮不上忙。
SearchOS:检索 agent 失败的固定形状是”一次搜索没捞到证据 → 换近义词再搜 → 历史越滚越长 → 预算烧完答案还是残的”。病因在于进度只存在于对话历史里——隐式、易丢、多 agent 间无法共享。解法是把进度搬到模型外面:任务建模为要填满的关系表,”还差哪些格子”变成可直接查询的覆盖率;已失败的搜索方式记录下来;中间件盯住停滞和预算耗尽,让”该打断了”成为外部判定。WideSearch 和 GISA 上全面领先单/多 agent 基线;需看消融才能分清收益来自显式状态还是并行调度。
腾讯 RxBrain:取消语言规划与视觉世界模型之间的接口,让语言(任务拆解、决策逻辑)和视觉想象(每步的物理状态预测)交替出现在同一条计划序列里。好处:计划每步天然带”执行完世界变成什么样”,不需额外校验层。代价:误差会串联,中间状态想象错了,后续语言推理就在错误前提上继续。关键问题是单序列路线扛不扛得住误差累积——摘要没有交代约束机制,需看全文。不做大规模动作数据预训练即可在真机上运行,但”promising”措辞待全文实验规模确认。
用二叉树将人群递归切成越来越细的子群,逐个喂给模型再按先验权重聚合——拆得越细,聚合出的估计反而越贴近真实人类调查数据,作者称之为”宏观谬误”的反转。主流前沿模型在多个领域普遍违背”按任意方式切分人群再加权聚合应还原同一总体分布”这条恒等式,说明子群层面的知识被直接问总体时传不上去。自检不需要标准答案:同一问题按年龄切一次、按地域切一次,两组聚合值应对得上,对不上就说明拿到的是笼统印象而非条件分布——做合成用户调研的团队值得先跑这个测试。
也值得关注
- 从法规描述生成自动驾驶测试脚本,核心指标是编译通过率 — 把它当成可机械验证的 DSL 代码生成,迭代式 RAG 的作用是把编译错误一轮轮修回来;评测思路比场景生成本身更通用
- 冻结小模型不改权重,把验证过的知识存成 KV 状态再 graft 回新上下文 — 无需微调即可向现有模型注入结构化知识的轻量化路线
- 连续空间的扩散语言模型,每个 token 有自己的时间步 — 打破离散 token 约束,探索连续扩散路线在语言生成上的可能性