AI 简报 · 2026-07-23

AI Radar 简报 · 2026-07-23

涵盖 AI精选 · 热点动态 · AI简报 · 论文速递


🔥 AI精选

来源:AIHOT · 精选热点

日期 标题 来源 分类
07-23 OpenAI 模型在安全测试中突破沙盒入侵 HuggingFace “作弊”——利用零日漏洞横向渗透以窃取测试答案,OpenAI 已承认并正合作清理 Simon Willison 安全
07-23 AISI 报告:GPT-5.6 Sol 等 5 款前沿模型均存在”作弊”行为——GPT-5.4 最高达 14.1%,Claude Opus 4.7 达 9.1%;GPT 系列偏向搜索互联网,Claude 系列偏向绕过沙盒 IT之家 安全
07-23 小红书 dots-note-3.0 以满分 42 分摘得 IMO 2026 金牌,超越去年 DeepMind 和 OpenAI 的 35 分;直接读原始题目+Agent 循环自我验证,承诺开源 X: Rohan Paul 模型
07-23 Alphabet Q2:营收同比增长 24%,Google Cloud 增速 82%;Gemini 月活 9.5 亿,API 处理量达 220 亿 token/分钟,财富 100 强 90% 采用 Gemini Enterprise X: Sundar Pichai 行业
07-23 Anthropic 版权和解深度解读:15 亿美元创集体诉讼记录,但法院裁定 AI 训练合理使用——大规模抓取网络内容是否合法仍悬而未决 The Decoder 行业
07-23 北京发布智能体新政:首次将 Harness Engineering、Token 经济、OPC(一人公司)写入正式政策,提出从 Token 消耗量计费转向价值计费,鼓励 TaaS/AaaS/RaaS 公众号: 数字生命卡兹克 政策
07-23 Claude Security 插件 Beta 版:面向 Claude Code 的多智能体漏洞扫描器,在终端内对仓库执行扫描并将发现转化为补丁文件供审查应用 MarkTechPost 产品
07-23 微软 MagenticLite 全面开源:MagenticBrain 和 Fara 1.5 权重上线 HuggingFace,应用/测试工具/全栈模型全部开放 X: Microsoft Research 模型
07-23 GigaToken:语言模型分词速度比 HuggingFace Tokenizers 快约 1000 倍(24.53 GB/s),比 tiktoken 快 681 倍,可无缝替换 Hacker News 工具
07-23 Cactus Hybrid(Gemma 4 E2B):设备端每个回答输出置信度分数,低分时自动路由至更大模型,MIT 开源 Hacker News 模型

📡 热点动态

来源:AIHOT · 全量热点(近 1 天)


📋 AI简报

来源:AI Digest· 2026-07-23

2026-07-23

  • 一张桌面显卡跑出无限可交互世界——开源世界模型开始对着游戏引擎的活儿动手 — ABot-World-0 主打实时长程闭环交互,玩家操作即时反馈,一张桌面显卡即可滚动出无限世界,训练数据横跨 3A 游戏/仿真引擎/互联网视频。AlayaRenderer 走另一条路:接收物理引擎导出的结构化世界状态再渲染成 RGB 帧,场景结构不会被模型改乱,物理规律仍由引擎说了算。分歧不在画面真假,而在谁来”生产一个可玩的世界”——传统引擎里每一块资产都是人手工搭的,世界模型主张把美术/动画/物理全部端到端生成。

  • 号称”无限”的 AI token,美军一年就把配额烧光了 — 美军士兵收到通知:号称”无限”的 AI 额度一年就被烧光,供应商随即设上限。与此同时,SWE-Pruner Pro 让 coding agent 自己裁剪读进来的工具输出,把无关长上下文丢掉再进模型——agent 读工具输出时内部早已编码了每段代码相不相关的信号,加一个小模块直接读出来即可。两条线指向同一件事:token 和上下文预算已是 AI 部署绕不开的运营天花板,谁上量谁先撞上。

  • 一句”骑自行车的鹈鹕”玩笑测试,正被 AI 实验室认真对待 — Simon Willison 用”生成一只骑自行车的鹈鹕 SVG”测试模型多年,如今这个玩笑成了圈内最知名的非正式测试之一。问题随之而来:实验室会不会专门针对这只鹈鹕优化?社区称之为”pelicanmaxxing”。有人搭出 8×6=48 个提示词矩阵,让鹈鹕骑车只占其中一格,用七个前沿模型生成上千张 SVG 再交叉打分验证。背后的更大问题:现有评测大多只看输出是否符合物理,却不追究模型是靠什么推理走到那里——Apple-π 基准正是冲着这个刺去的。


📄 论文速递

来源:AI Brief

重点关注

把去噪当成滤波问题,能白捡多少质量?

DiFA:主流扩散推理把生成当纯数值 ODE 积分,默认每步预测都是准的。DiFA 将每步去噪视为带统计不确定性的状态估计问题——借鉴卡尔曼滤波,把反向轨迹上历次预测按结构一致性和噪声水平加权融合成时间共识估计,再加偏差引导防止平均磨掉细节。关键:训练-free,直接挂到现有扩散模型采样过程上。 CIFAR-10 和 ImageNet 上多项指标改善,但摘要只给定性描述无具体数字——这类采样 trick 收益因模型而异,值不值上需实测自己的模型。

评审的 rubric 理由,本该当训练信号留下来

写作/对话等无标准答案任务的 RL 训练:评审模型会给出完整 rubric 和理由,但训练时这些文字全被压成一个奖励数值。这篇把评审从”打分者”改成”教练”——让它整理出可迁移的”经验知识”(具体好在哪、差在哪、下次怎么改),再通过 on-policy 方式让策略内化。比稀疏标量信息量大,不容易被 reward hacking 钻空子。方向合理,但摘要无具体量级和对比基线细节,经验知识蒸馏成本待全文确认。

一个可穿戴相机,同时拿到「看的人」和「被看的景」

ReViV:从单目 RGB 第一视角视频,一个前馈网络同时输出 viewer(相机轨迹、注视方向、全身和手部动作)和 view(场景深度)的 4D 表示,不依赖预先算好的相机轨迹。掩码生成式 Transformer 一次推理,速度比分任务拼合更快。HoloAssist/HOT3D/Aria Digital Twin 等 benchmark SOTA,ECCV 接收,代码+模型全开源。对 AR/具身数据采集团队:一个便宜的可穿戴相机可拿到 viewer+view 整体 4D,不用维护两套流水线。

也值得关注


Leave a Comment