AI Radar 简报 · 2026-06-29
涵盖 AI精选 · 热点动态(AI Digest、论文源及 SAP 今日无数据)
🔥 AI精选
来源:AIHOT · 精选热点
| 日期 | 标题 | 来源 | 分类 |
|---|---|---|---|
| 06-28 | CEO-Bench:500 天创业存活测试,仅 Claude Fable 5、Opus 4.8、GPT-5.5 盈利超起始资本 | The Decoder | 研究 |
| 06-28 | Grok 4.5 私测于 SpaceX 和 Tesla,基于 1.5T V9 基础模型,初评性能”接近或超越 Opus” | X: Elon Musk | 模型 |
| 06-28 | VibeThinker-3B:3B 参数在 AIME26 数学基准持平 DeepSeek V3.2(大 200 倍),印证”推理可压缩,事实知识不能” | The Decoder | 模型 |
| 06-28 | 开源模型生态扩容:Cohere 以 Apache 2.0 开源旗舰模型 Command A+,NVIDIA 发布 Nemotron-3-Ultra-550B | Nathan Lambert | 行业 |
| 06-29 | Vibe Coding 必备两个 Prompt:第一性原理推导 + 对抗式审查,形成生成-验证闭环 | 公众号: 数字生命卡兹克 | 技巧 |
| 06-28 | Wayfinder Router:微秒级本地路由决策,无需调用模型,在本地和托管 LLM 之间确定性路由 | Hacker News | 产品 |
📡 热点动态
来源:AIHOT · 全量热点(近 1 天)
-
06-29 OpenAI GPT 5.6 Sol 灰度测试:用 Juice Prompt 验证是否被灰度(返回 128=5.6 Sol,768=5.5),Codex 可能悄悄路由部分 xhigh 会话 —
X: 宝玉
宝玉实测返回 768,说明覆盖范围仍有限;社区正在摸索验证方式,5.6 Sol 能力情况未公开披露。 -
06-29 Flash 系列横评:Step-3.7-Flash Token 效率极高适合 Agent 框架驱动;DeepSeek-V4-Flash 后端强适合 AI-Ops;Gemini-3.5-Flash 擅长”漂亮活” —
X: karminski
面向多智能体系统和 RAG 驱动的实用评测,三款 Flash 级模型各有差异化优势。 -
06-29 福特召回 350 名退休资深工程师重新调教 AI 质检系统:时隔 16 年重返 JD Power 主流品牌第一,节省约 10 亿美元质保召回成本 —
X: 宝玉
副总裁坦言”曾错误认为引入 AI 就能产出高质量产品”——人机协作的成功案例,AI 工具需要领域专家调教才能真正发挥价值。 -
06-29 《Red Queen Gödel Machine》:剑桥/NVIDIA 提出智能体与评估者协同进化,以 1.35-1.72× 更少 token 超越此前最佳自改进编程智能体 —
X: Rohan Paul
论文写作中协同进化写作者获约 1.86 倍平均接收率提升——更强 AI 需要更强评估者共同成长,固定基准会导致分数停滞或被利用。 -
06-29 AA-Briefcase 评估:多周复杂咨询任务测试,开放权重模型与封闭模型之间差距清晰可见,但进展速度令人意外 —
X: Ethan Mollick
前沿曲线显示封闭模型仍保持显著优势,但开放模型缩小差距的速度超出预期。 -
06-29 北京太空算力创新中心揭牌:星载 AI 芯片、太空大模型攻关,采用”公司+联盟”双轮驱动 —
IT之家
落地海淀中关村,与 4 月成立的”太空算力专业委员会”配套,中国太空算力基础设施建设提速。 -
06-29 深圳警方通报:用 AI 编造”东鹏特饮创始人不喝自家饮料”谣言,自媒体人被刑事拘留 —
IT之家
AI 工具辅助散布商业谣言的首批刑事案例之一,警方宣布常态化打击 AI 辅助网络谣言。 -
06-29 央行行长警告 AI 热潮可能引发全球金融危机,《The Telegraph》报道 BIS 年度报告关键结论 —
Hacker News
监管机构对 AI 资产泡沫与金融体系脆弱性的系统性担忧进入主流政策讨论。 -
06-29 Bugu 开源 macOS 工具:防止 Agent 运行时合盖休眠,心跳音效提示 5 种状态(接收/运行/成功/中断/授权) —
公众号: 卡兹克
使用 Codex 和 Kimi Code K2.7 联合开发,Kimi Code 中等编码任务 180 tok/s,短上下文 260 tok/s(速度提升 6 倍),已开源至 GitHub。 -
06-29 Roboflow Supervision 视觉工具包三周增长 5K Star 达 45K:模型无关推理,几行代码完成检测/追踪/标注可视化 —
X: Berry Xia
将常见 CV 工作流抽象为复用组件,大幅降低重复造轮子成本,社区生态丰富。 -
06-29 HN 用户呼吁科技新闻提供”过滤 AI 内容”选项:Techmeme 等已被 AI 新闻淹没,需要非 AI 科技讨论空间 —
Hacker News
反映 AI 内容泛滥带来的信息疲劳——从某种意义上说,这份 AI 简报本身也是这个现象的一部分。 -
06-29 Vibe Coding 两个核心 Prompt 技巧:第一性原理 + 对抗式审查,AIHOT 已凭此达周请求量超千万次 —
X: 卡兹克
第一性原理帮助发现底层架构隐患并重构,对抗式审查检出 OOM 死循环/时间污染等手工难发现的 Bug。 -
06-28 CEO-Bench 500 天模拟:Claude Fable 5 最佳轮次盈利 4715 万美元,一个简单规则启发式以 1576 万跑赢大多数 AI 模型 —
The Decoder
多数模型无法保持连贯策略而破产,衡量 AI 长期战略决策能力的关键基准。 -
06-28 Grok 4.5 SpaceX/Tesla 私测补充细节:加入 Cursor 数据补充训练,SpaceX 今年将每月发布完全从头训练的新模型 —
X: Elon Musk
每月一个全新模型的研发节奏如果成真,将是当前 AI 竞赛中最激进的发布频率。 -
06-28 VibeThinker-3B 技术细节:基于 Qwen2.5-Coder-3B,经 SFT+RL+自蒸馏多阶段后训练;LeetCode 竞赛解决 123/128 题超越 GPT-5.2 和 Kimi K2.5 —
The Decoder
但在 GPQA-Diamond 知识密集型任务大幅落后,印证”推理可压缩,广泛世界知识仍需大参数”假说。
📋 AI简报
来源:AI Digest
今日无推送数据。
📄 论文速递
来源:AI Brief
今日无推送数据。