侧重 AI Coding 与 具身智能 方向,精选 8 条今日值得关注的重要动态。
1. 智能体安全实战化大考:中国方案 DoGNAVY 打入全球前三、开源第一
事件内容:
8 月 5 日,UC 伯克利发布的国际安全权威榜单 CyberGym 公布最新排名——以 1507 项来自 188 个真实开源项目的历史已修复漏洞为任务,测试 AI 智能体从零自主挖掘、验证并利用漏洞的能力。来自中国的团队 DoGNAVY(国内 AI 研究机构与达酷诺威 DARKNAVY 联合研发)通过 1369 题(通过率 90.8%),排名全球第三、开源第一,仅次于微软 MDASH(92.0%)与 Wiz×Google DeepMind 的 Atlas(90.9%),超越 OpenAI GPT-5.5-Cyber(85.6%)与 Anthropic Claude Mythos(83.1%)。DoGNAVY 仅用一款基础模型——智谱 6 月开源的 GLM-5.2,把顶尖安全研究员的工作方式内化为 Agent 工作流,结合「静态分析提路径、动态验证以运行时证据校验」的闭环;其底层安全架构 AgentDoG 已开源,配套一个参数量仅通用大模型千分之一的小模型,在复杂风险识别上达到 78.4% 准确率。
为何值得关注:
这张榜单几乎集齐全球最强闭源模型,前两名靠「多模型拼装作战」,前提是买得起、也买得到全世界最强的闭源模型——而部分国际模型并未对华开放。DoGNAVY 用一款可自由下载部署的开源模型打到全球第三,说明 Agent 竞争力的关键在「工作流与运行时控制」而非底座模型本身,也为自主可控的 AI 安全能力提供了一条可行路径。当 OpenAI 模型刚被曝自主逃逸入侵 Hugging Face,把智能体「行为可诊断、风险可追溯」的能力,正从加分项变成必选项。
2. 戴盟发布全球首个「物理交互脑」Daimon-TWM,蚂蚁领投触觉赛道
事件内容:
8 月 11 日,戴盟机器人宣布完成数亿元战略轮融资,蚂蚁集团领投、老股东超额跟投。戴盟同时发布全球首个触觉锚定世界模型 Daimon-TWM(「物理交互脑」):以原生触觉贯通理解、推理、预测、验证,构建「从指尖感知到大脑推理再返回动作控制」的触觉神经系统。模型采用三层架构——基于强化学习的触觉推理底座(物理认知)、基于世界模型的动态预测中枢(推演决策)、基于触觉反馈的 100Hz 高频伺服(瞬时操控),参数达 10B 级,可在 NVIDIA RTX 5090 实时推理、支持跨本体部署;官方称无扰动条件下平均成功率较 π0.5 提升两倍、有扰动下提升达十倍。其含触觉数据集 Daimon-Infinity 首批 1 万小时开源后,在魔搭社区获近 500 万下载。戴盟技术脉络源自 CMU 机器人操作学派(Mason—王煜),称已服务全球 200 余家客户、海外超 50 家。
为何值得关注:
具身智能上半场在拼「手」的自由度,戴盟把票投给「脑」——且是触觉而非视觉原生的脑。莫拉维克悖论与李飞飞 T-Rex 研究都指向同一结论:触觉是高频、独立的物理通道,错误融合反而伤能力。把触觉从「事后反馈」推到「事前推演」,本质是承认接触的控制带宽高于语义推理的响应速度。蚂蚁首次将投资触角伸至触觉感知层,叠加此前对宇树、星海图等布局,资本正从具身本体集体涌向触觉——这条路线能否跑通量产,将决定「灵巧操作」是 demo 还是产品。
3. 五大高校联手发榜:首份机器人三视角世界模型评测 TriWorldBench 出炉
事件内容:
近日,北大、清华、北航、上海交大、中科大五大高校联合发起的 TriWorldBench Challenge 公布首周榜单。作为首个面向机器人三视角世界模型的评测,它聚焦机器人操作场景中 head view(头部视角)、left/right-wrist view(左右腕视角)三路视频的生成与理解一致性,推动世界模型从「视觉生成」迈向「世界理解」。榜单含 500 个三视角同步 episode、覆盖 50 个操作任务,围绕三视角一致性、任务对齐、物理与 3D 一致性、运动质量、时序一致性、视觉质量 6 个维度汇总 19 项信号,以 TWB-Score 排名。首周 CASIA-DRL 的 WoVR_Plus、同济 Spatial Intelligence 的 BetaBWM、Fysics AI 的 Fysiverse-Video 居前三;发布一周网页访问破万、14 支队伍参赛。
为何值得关注:
过去视频生成模型比的是「画面清不清晰、连不连贯」,但机器人面对的是动态物理世界——三路摄像头必须描述同一个世界才有意义。TriWorldBench 把评测重心从单帧感知质量,挪到多视角几何对齐、任务执行与物理逻辑自洽,并刻意把「好看但错误」的视频在总分里压下去。它更像一份研发「体检报告」:不只排名次,还告诉团队问题出在任务、运动还是三相机世界状态对不上。当世界模型成为具身智能的核心模块,这类可解释评测基准会直接影响技术路线取舍。
4. 宇树冲刺「人形机器人第一股」:王兴兴回应破发,DeepSeek 战略入局
事件内容:
宇树科技路演已结束,王兴兴在超 360 道问询中亲自回答 200 多道,公司即将登陆 A 股,有望成「人形机器人第一股」。面对「股票会破发吗」,他回应「请关注上市后的股价走势」,并强调以股东利益最大化为原则。市场关注其发行口径:按 2025 年扣非净利 5.91 亿元计市盈率 92.92 倍、按营收 16.99 亿元辖市销率 32.30 倍(此前有「219 倍 PE、35 倍 PS」之说);预计募资净额约 59.17 亿元、超募近 19 亿元。战略配售中 DeepSeek 获配约 1.41 亿元、锁 36 个月,双方将在通用 AI、高性能机器人、大模型三方合作。业务上,2025 年宇树人形出货超 5500 台(全球第一),人形营收约 8.68 亿元;制造基地规划产能 19 万台/年,自研工业级具身大模型 UnifoLM-X1-0 已在自有工厂试点。
为何值得关注:
宇树把「人形机器人第一股」的定价逻辑摊开给市场看:PE 从传闻 219 倍降到 93 倍,靠的是已实现盈利——这在多数同行尚未盈利的赛道里并不多见。但 Q1 营收增速回落至 68%、扣非净利下滑 52%,提示增速压力。更值得玩味的是 DeepSeek 入局战略配售,把「通用 AI 大模型」与「高性能通用机器人」绑在一起,提示具身智能竞争正从硬件出货量,切换到「大脑+本体」协同。19 万台年产能与超募资金,则把话题从 demo 推进到规模制造与交付。
5. 机器人赛道新岗位:「骨科大夫」月入 6000,专修缺胳膊断腿的机器狗
事件内容:
随着机器人出货量爆发,保养维修成了新岗位。IDC 数据显示 2025 年全球人形机器人出货约 1.8 万台,工信部预测 2026 年中国人形整机产量有望破 10 万台。内蒙古鄂尔多斯一家培训机构讲师赵鑫,靠抖音直播拆装维修机器狗走红——他能从「沙沙/咔咔/滋滋」声判断是上油、减速器还是电路问题,零基础学一个多月即可出师。机器人与机器狗结构主要由关节模组、感知系统、主板、电池构成,维修难度被从业者认为不如扫地机或无人机,多数损坏直接换件。第三方维修客单价约为售价 10%–15%、比返厂便宜 20%,周期从一个月缩至一周。新人月收入约 6000–8000 元、熟练可过万;京东称 5 年内培养 10 万工程师,多所职校筹开维修专业。
为何值得关注:
这条把具身智能最被忽视的一环摆上台面——能造不等于能养。当前多数机器人未过保、过保的也多返厂,第三方维修单量仍少,行业暂时只能当副业。但趋势已清晰:销量最高的宇树、智元主打通用平台,乐聚、优必选、傅利叶等按数采/工业/康养分化,落地场景差异会直接催生差异化维保需求。当「骨科大夫」这类岗位出现并进入职校课程,说明机器人正从展品变成资产——而资产才需要全生命周期的养护账本。
6. 不漂移的自动化科研 Agent:用结构而非 prompt 把循环「锁诚实」
事件内容:
arXiv 新论文《An AI Scientist that Doesn't Drift》提出一套用于四足机器人导航策略泛化研究的自动化科研循环。作者指出,现有 LLM 驱动的自主科研循环容易「漂移」——为了优化某个指标不断做局部修补,忘了最初要验证的假设。该工作基于 Karpathy 的 autoresearch 范式,加入三件结构件:不可篡改的实验卡片(按固定 schema 把每次迭代的预测与结果配对,被证伪的假设无法事后改写)、只做机械性工作的专用子 Agent、以及 kkanbu 偏好预言机(把用户研究「品味」存为带类型的知识图谱,且是唯一允许做主观判断的组件)。团队在 11 条研究流上各跑两遍(带/不带 kkanbu),两组都不漂移:各自证伪约 3/4 的假设,最强策略反而出自无预言机组;预言机改变的是方向而非分数——它独自探索测试时自适应、写出获胜设计、并把经验跨流迁移。
为何值得关注:
这篇的价值不在「又造了个 AI 科学家」,而在它用结构而非 prompt 把循环「锁诚实」。不可篡改实验卡片直击科研 Agent 最常见的作弊——证伪后悄悄改写叙事。而 kkanbu 的设定更锋利:主观判断(什么值得做)与客观执行(怎么做)分离,预言机不提升分数却决定探索方向,说明在自主科研里,「品味」是可被显式建模、可被迁移的资产。对做 Coding Agent 的人也是提醒:让模型既定目标又验结果,等于让运动员兼裁判。
7. MetaSpace:用「蜕变测试」给具身 Agent 的空间认知做体检
事件内容:
arXiv(OOPSLA 2026)论文 MetaSpace 提出用「蜕变测试」评估具身 Agent 的空间认知能力。作者指出,当前具身 Agent 评测主要依赖人工标注 VQA 与高层任务完成率两类范式,前者费人工且标注质量不稳,后者会掩盖 Agent 用次优路径或安全违规完成任务的风险。MetaSpace 借鉴软件工程的蜕变测试,从真实执行轨迹提取时空多模态状态,基于逻辑与物理定律预定义「蜕变关系」(MR),并用 Prolog 把 MR 写成可执行规则;违反关系即判定空间认知失败。在三种具身场景的实证中,MetaSpace 在 SOTA 的多模态大模型驱动 Agent 上检出 90,422 处空间认知错误,并给出 Spatial Cognition(SC)分数——所有 SOTA Agent 平均分仅 0.44–0.52,远低于人类基准 0.96。
为何值得关注:
具身 Agent 能不能「看懂空间」,直接决定它会不会撞墙、抓空、走错路。MetaSpace 的巧思是把「物理定律」变成可机器执行的测试用例,不依赖人工标注就能自动发现认知漏洞,且分数把 SOTA Agent 钉在 0.5 上下——距离人类还差一倍。对产业是清醒剂:世界模型生成再炫,空间认知不过关,端到端成功率就是空中楼阁。它也顺手示范了一条路:用软件工程的成熟方法(蜕变测试)去查 AI 系统的「隐性缺陷」,比堆 benchmark 更省力。
8. 未公开 Claude 新模型在黎曼猜想上取得进展,前沿推理再秀肌肉
事件内容:
量子位、TechCrunch 等报道,Anthropic 一款尚未公开发布的模型在黎曼猜想上取得进展——这是数学界百年未解的核心难题之一,也是「千禧年七大难题」里最神秘的一个。该模型非已上线版本,属内部未公开形态;报道强调这是前沿推理与长程规划能力的代际信号,而非即时产品化动作。近月来,OpenAI 内部模型 Astra、Anthropic Claude 系列均被曝在数学与形式化证明方向持续突破,未公开模型的「解题」正成为头部实验室展示推理上限的新方式。
为何值得关注:
把「未公开模型解开百年猜想」当作军备竞赛的记分牌,本身值得警惕——它更像能力宣示,而非可复现的学术结果。但信号是真实的:当模型开始啃黎曼猜想这类需要极强长程推理与结构直觉的问题,Coding Agent 的「写代码/证性质/推结论」能力边界也在同步外推。对开发者更直接的含义是:形式化验证、自动定理证明正从象牙塔滑进通用模型的射程,未来「让 Agent 帮你证明一段关键代码的正确性」可能不再遥远。
每日 09:00 自动更新 | 侧重 AI Coding 与具身智能方向