AI Radar 简报 · 2026-07-01
涵盖 AI精选 · 热点动态 · AI简报 · 论文速递
🔥 AI精选
来源:AIHOT · 精选热点
| 日期 | 标题 | 来源 | 分类 |
|---|---|---|---|
| 06-30 | Claude Sonnet 5 发布:自主运行能力接近 Opus 4.8,智能体能力大幅提升,推广期 $2/$10 每百万 tokens | Anthropic | 模型 |
| 07-01 | Fable 5 和 Mythos 5 恢复访问:出口管制解除,新安全分类器阻断越狱 99%+,Pro/Max 用户 7 月 7 日前周额度 50% | Anthropic | 行业 |
| 07-01 | Anthropic 在 Claude Code 植入隐写术识别中国用户:读取时区和域名列表,修改 Unicode 字符作标记,7 月 2 日更新删除 | 公众号: 数字生命卡兹克 | 行业 |
| 06-30 | Claude Science 科研工作台 Beta 上线:60+ 预配置技能覆盖基因组/蛋白质组/化学信息学,内置 reviewer agent 自动检查引用错误 | Anthropic | 产品 |
| 07-01 | 美团 LongCat-2.0 发布并开源:1.6T 万亿参数,五万卡国产算力全流程训练,1M 超长上下文,SWE-bench Pro 59.5 | 公众号: 美团 | 模型 |
| 07-01 | 亚马逊 AWS 砸 10 亿美元设前置驻场工程师团队,45 天驻场协助企业落地 AI 与智能体应用 | IT之家 | 行业 |
| 07-01 | AI 通过 Prover-Verifier LLM 循环攻克 9 个未解数学难题,包括一个困扰研究者 2 年的理论计算机科学问题 | X: AI Safety Memes | 研究 |
| 06-30 | Claude Desktop Linux 公测版发布(Ubuntu 和 Debian),Chat+Code+Cowork 完整体验 | X: Claude Devs | 产品 |
| 06-30 | Google DeepMind 发布 Nano Banana 2 Lite:4 秒出图、$0.034/千像素;Gemini Omni Flash 支持高画质视频生成与对话式编辑 | Google DeepMind | 模型 |
| 06-30 | ADK Go 2.0:基于图的工作流引擎 + HITL 编排 + 动态执行,单智能体与复杂图统一运行时 | Google Developers | 产品 |
📡 热点动态
来源:AIHOT · 全量热点(近 1 天)
-
07-01 Anthropic 确认回滚 Claude Code 隐写术代码,Fable 5 全球恢复、Mythos 5 对批准的美国组织开放 —
IT之家
代码自 4 月 2 日 v2.1.91 版本起内置,旨在防账户转售和模型蒸馏攻击;社区逆向发现后引发广泛质疑,Anthropic 将于 7 月 2 日新版本中完全删除。 -
07-01 美团 LongCat-2.0 实测:Agent 场景 Terminal-Bench 2.1 追平 Gemini 3.1 Pro,FORTE 与 Claude Opus 4.6 持平,可直接接入 Claude Code/Codex —
公众号: 卡尔
无回滚/无不可恢复 loss 突刺,全程国产芯片训练;OpenRouter 月调用量跻身全球前三。 -
07-01 Sonnet 5 新 tokenizer 导致实际费用与 Opus 4.8 相近,引发争议;编程场景 GPT 5.5 仍首选 —
X: Oran Ge
Sonnet 5 在金融领域(GDPeval)表现最佳,擅长工具核查;Opus 4.8 在复杂编程、规划和 HTML 设计上更强。 -
07-01 NVIDIA 发布 Nemotron-Labs-TwoTower:双塔架构扩散语言模型,保留 98.7% AR 基线质量、生成吞吐量提升 2.42 倍 —
MarkTechPost
冻结自回归骨干 + 训练降噪器塔,支持扩散/模拟 AR/AR 三种解码模式,总参数 ~60B、每 token 活跃 ~3B。 -
07-01 Claude Code 智能体循环官方指南:四种循环类型(turn-based/goal-based/time-based/proactive)及 SKILL.md 编写方法 —
Claude Blog
/goal设定可验证完成标准;/loop按时间间隔重复;/schedule移至云端;SKILL.md 将人工验证步骤编码让 Claude 自检。 -
07-01 三星 HBM4E 良率突破 70%,D1d 工艺竞争力领先对手,HBM4 量产用于 Vera Rubin,HBM4E 计划用于 Vera Rubin Ultra —
IT之家
AI 芯片内存供应链关键节点,三星在 HBM4 量产时间上已落后 SK Hynix,HBM4E 节点将是重要追赶窗口。 -
06-30 Meta 秘密测试 ChatGPT/Gemini/Character.AI:雇用数百人假扮未成年发送 4.5 万条危机提示,被测试公司完全不知情 —
The Decoder
Meta 称是行业标准安全测试;Character.AI 称违反服务条款,OpenAI 已调查,Google 称未批准——AI 安全研究伦理边界引发争议。 -
06-30 Google Research 推出 TabFM:表格数据零样本基座模型,无需调参即可分类和回归,BigQuery 将通过 SQL 命令集成 —
MarkTechPost
整个数据集作统一提示,单次前向传播生成预测;TabArena 基准上优于深度调优的监督算法,已开源于 HuggingFace。 -
07-01 Claude Code 隐写术技术细节:base64+XOR(密钥 91)加密 147 个域名列表,修改系统提示词 Unicode 字符(U+0027 替换),2-3 比特标记 —
X: 卡兹克
该工具具有文件系统访问和 Shell 执行权限,社区将此举视为对开发者信任的背叛。 -
07-01 Perplexity CEO:AI 使用重心从普通用户转向重度用户——单个重度用户消耗可匹敌小团队,月支出超 1 万美元 —
X: Rohan Paul
企业内部已出现多智能体层级和 agent loops 架构,远超平均预期——AI 行业收入结构正在向少数高密度用户集中。 -
07-01 编写可预测 AI Skill 指南:model-invoked vs user-invoked 区分,三层信息结构,五种失败模式(Premature completion/Duplication/Sediment/Sprawl/No-op) —
X: 邵猛
Matt Pocock 的 /writing-great-skills 是其最常调用的 Skill,用 leading word 压缩行为要求,No-op 测试判断句子是否有效。 -
06-30 NotebookLM Short Video Overviews 全量上线 Web 英文版:60 秒竖屏视频自动讲解任意概念,免费用户即将可用 —
X: NotebookLM
此前限 AI Ultra/Pro 订阅者,现面向所有 Web 英文用户开放。 -
06-30 Grant Sanderson(3Blue1Brown)谈 AI 与数学:IMO 金牌≠AGI,AI 解决千禧年难题也可能存在人类无法被自动化的任务 —
Dwarkesh Patel
探讨概念突破验证周期可长达一个世纪、Riemann 假设 AI 证明能否被人类理解,以及现实经济任务难以套用 RL 环境等话题。 -
06-30 库克与欧盟就新版 Siri 举行会谈:苹果提出”可信系统代理”方案被拒,因 DMA 互操作义务暂不在欧盟推出 —
IT之家
苹果要求 18 个月监管宽限期遭拒,欧盟 DMA 合规路径仍悬而未决,欧洲用户暂时无法体验 Gemini 驱动的新 Siri。 -
06-30 Acti:将 AI 智能体放入手机键盘,长按键位执行 Skills,两周内用户创建超 1000 个技能,获 530 万美元种子轮 —
TechCrunch
本地优先架构默认不访问私人消息,新加坡初创将 AI 入口从 App 层下移至系统键盘层。
📋 AI简报
来源:AI Digest· 2026-07-01
2026-07-01
-
决定 agent 上限的不再是参数量,而是它能跑多长的任务链 — Agents-A1 是 35B MoE 模型,性能摸到万亿级旗舰水平——靠的是拉长单次任务步数(平均 45 步轨迹)而非堆参数。开源社区 DeepReinforce 的 Ornith-1.0 同样押注 self-scaffolding,Claude Sonnet 5 的定位也是”几个月前还需要更大更贵模型才能做到的自主能力”。同一个故事:任务链长度正在替代参数量成为 agent 能力的决定性变量。
-
Anthropic 新旗舰要陪科学家做实验;OpenAI 同周造基准先给 AI 科研能力打分 — Claude Science 定位是给高层指令就能自主推进科研的 AI 协作者;OpenAI 同周推出 GeneBench-Pro,用真实基因组数据集反过来考 AI。一个抢着当合作者,一个先要当评分者——两种押注最终都落在研究者头上。
-
你买的奇异花种子,那种花根本不存在 — eBay/亚马逊/Etsy 上充斥着用 AI 生成的不存在花卉图片配套卖种子的骗局。Nano Banana 2 Lite 每秒可批量产出上千张图,当造假边际成本趋近于零,平台”人工审核跟得上上架速度”的前提就塌了——一个用真实成本作为安全壁垒的假设正在系统性失效。
📄 论文速递
来源:AI Brief
重点关注
OSWorld 2.0:108 个端到端工作流,人类中位 1.6 小时、平均 318 次工具调用。最强的 Claude Opus 4.8(最大思考+批量工具调用)在 500 步内完成 20.6%;GPT-5.5 完成 13%。失败原因拆解更有价值: agent 栽的不是 GUI 操作或写代码,而是丢失约束、漏掉任务中途到达的信息、该问用户时选择猜测、跳过验证步骤——这些正是真实工作里最常见的问题。
PolicyGuard:把合规校验器从”执行前单参数检查”改为”读完整对话再推理的子 agent”,可针对下一轮给出具体修正建议。在 tau²-Bench 航空场景,跨三家模型通过率提升 6-12 个百分点;更重要的是:在更高违规召回率下,阻断次数只有参数级守卫的一半——误拦更少、干扰更小。
VG-GUIBench:评测 GUI agent 能否从教程视频中学到可迁移操作技能,再去完成下游长链路任务。TASKER 算法通过同时考虑任务相关性和场景动态改进关键帧抽取,EgoSchema 上比最好 baseline 高 2.0%。真正价值:把视觉理解评测从”感知”推向”看了能不能用”。
MirrorPPR:不给指令,给”修前/修后”样例对,让模型从中推断修图操作并套到新人像。”下巴收一点、肤色调匀”这类精细调整文字说不清,看样例却一目了然。用操作提取器注入扩散 Transformer(DiT),配套 4700 万对训练数据集。
MD-3k 基准:揭示单目深度模型在透明/分层场景下的”层偏好”因模型而异——所谓真值是标注约定,不是场景本身的属性。一个不需训练的 Laplacian Visual Prompting 就能让冻结模型改报另一层,最强组合 75.5% 准确率。提醒:模型在透明场景”出错”时,错的可能是监督标签而非模型本身。
也值得关注
- Apple 按”覆盖度”而非纯注意力分数淘汰 KV cache — 长上下文推理更省,又不掉点
- 不改预训练权重,只缩放选定层的注意力头激活 — 几乎零额外参数给 VLM 补上空间推理
- 模型写在 scratchpad 上的中间状态,后面真会读回去吗? — Stanford 追问中间变量是参与了计算还是只是好看
- 让多个 LLM 协作时自创一套紧凑符号 — 替代冗长自然语言 CoT,换来更高推理效率
- 用”贝叶斯惊讶”当奖励信号 — Allen Institute 引导 LLM 在长程假设搜索-验证循环里挑下一个该验的假设