AI 简报 · 2026-07-01

AI Radar 简报 · 2026-07-01

涵盖 AI精选 · 热点动态 · AI简报 · 论文速递


🔥 AI精选

来源:AIHOT · 精选热点

日期 标题 来源 分类
06-30 Claude Sonnet 5 发布:自主运行能力接近 Opus 4.8,智能体能力大幅提升,推广期 $2/$10 每百万 tokens Anthropic 模型
07-01 Fable 5 和 Mythos 5 恢复访问:出口管制解除,新安全分类器阻断越狱 99%+,Pro/Max 用户 7 月 7 日前周额度 50% Anthropic 行业
07-01 Anthropic 在 Claude Code 植入隐写术识别中国用户:读取时区和域名列表,修改 Unicode 字符作标记,7 月 2 日更新删除 公众号: 数字生命卡兹克 行业
06-30 Claude Science 科研工作台 Beta 上线:60+ 预配置技能覆盖基因组/蛋白质组/化学信息学,内置 reviewer agent 自动检查引用错误 Anthropic 产品
07-01 美团 LongCat-2.0 发布并开源:1.6T 万亿参数,五万卡国产算力全流程训练,1M 超长上下文,SWE-bench Pro 59.5 公众号: 美团 模型
07-01 亚马逊 AWS 砸 10 亿美元设前置驻场工程师团队,45 天驻场协助企业落地 AI 与智能体应用 IT之家 行业
07-01 AI 通过 Prover-Verifier LLM 循环攻克 9 个未解数学难题,包括一个困扰研究者 2 年的理论计算机科学问题 X: AI Safety Memes 研究
06-30 Claude Desktop Linux 公测版发布(Ubuntu 和 Debian),Chat+Code+Cowork 完整体验 X: Claude Devs 产品
06-30 Google DeepMind 发布 Nano Banana 2 Lite:4 秒出图、$0.034/千像素;Gemini Omni Flash 支持高画质视频生成与对话式编辑 Google DeepMind 模型
06-30 ADK Go 2.0:基于图的工作流引擎 + HITL 编排 + 动态执行,单智能体与复杂图统一运行时 Google Developers 产品

📡 热点动态

来源:AIHOT · 全量热点(近 1 天)


📋 AI简报

来源:AI Digest· 2026-07-01

2026-07-01

  • 决定 agent 上限的不再是参数量,而是它能跑多长的任务链 — Agents-A1 是 35B MoE 模型,性能摸到万亿级旗舰水平——靠的是拉长单次任务步数(平均 45 步轨迹)而非堆参数。开源社区 DeepReinforce 的 Ornith-1.0 同样押注 self-scaffolding,Claude Sonnet 5 的定位也是”几个月前还需要更大更贵模型才能做到的自主能力”。同一个故事:任务链长度正在替代参数量成为 agent 能力的决定性变量。

  • Anthropic 新旗舰要陪科学家做实验;OpenAI 同周造基准先给 AI 科研能力打分 — Claude Science 定位是给高层指令就能自主推进科研的 AI 协作者;OpenAI 同周推出 GeneBench-Pro,用真实基因组数据集反过来考 AI。一个抢着当合作者,一个先要当评分者——两种押注最终都落在研究者头上。

  • 你买的奇异花种子,那种花根本不存在 — eBay/亚马逊/Etsy 上充斥着用 AI 生成的不存在花卉图片配套卖种子的骗局。Nano Banana 2 Lite 每秒可批量产出上千张图,当造假边际成本趋近于零,平台”人工审核跟得上上架速度”的前提就塌了——一个用真实成本作为安全壁垒的假设正在系统性失效。


📄 论文速递

来源:AI Brief

重点关注

当任务长到 1.6 小时,前沿 agent 只能做完两成

OSWorld 2.0:108 个端到端工作流,人类中位 1.6 小时、平均 318 次工具调用。最强的 Claude Opus 4.8(最大思考+批量工具调用)在 500 步内完成 20.6%;GPT-5.5 完成 13%。失败原因拆解更有价值: agent 栽的不是 GUI 操作或写代码,而是丢失约束、漏掉任务中途到达的信息、该问用户时选择猜测、跳过验证步骤——这些正是真实工作里最常见的问题。

合规校验,错的不是模型而是切入点

PolicyGuard:把合规校验器从”执行前单参数检查”改为”读完整对话再推理的子 agent”,可针对下一轮给出具体修正建议。在 tau²-Bench 航空场景,跨三家模型通过率提升 6-12 个百分点;更重要的是:在更高违规召回率下,阻断次数只有参数级守卫的一半——误拦更少、干扰更小。

模型看得清画面,但能照着教程视频把事做完吗?

VG-GUIBench:评测 GUI agent 能否从教程视频中学到可迁移操作技能,再去完成下游长链路任务。TASKER 算法通过同时考虑任务相关性和场景动态改进关键帧抽取,EgoSchema 上比最好 baseline 高 2.0%。真正价值:把视觉理解评测从”感知”推向”看了能不能用”。

把人像精修变成”看样例模仿”

MirrorPPR:不给指令,给”修前/修后”样例对,让模型从中推断修图操作并套到新人像。”下巴收一点、肤色调匀”这类精细调整文字说不清,看样例却一目了然。用操作提取器注入扩散 Transformer(DiT),配套 4700 万对训练数据集。

一条光线穿过玻璃,单目深度模型该报哪个深度?

MD-3k 基准:揭示单目深度模型在透明/分层场景下的”层偏好”因模型而异——所谓真值是标注约定,不是场景本身的属性。一个不需训练的 Laplacian Visual Prompting 就能让冻结模型改报另一层,最强组合 75.5% 准确率。提醒:模型在透明场景”出错”时,错的可能是监督标签而非模型本身。

也值得关注


Leave a Comment