侧重 AI Coding 与 具身智能 方向,精选 8 条今日值得关注的重要动态。
1. DeepSeek 1.41 亿战略配售宇树 IPO,锁定期 36 个月冠绝全场
事件内容:
宇树科技 8 月 6 日公布科创板 IPO 战略配售结果,9 家投资者参与,杭州深度求索(DeepSeek 母公司)赫然在列,获配 93.339 万股,占本次发行总量 2.31%,按 150.80 元/股发行价计算认购金额约 1.41 亿元。关键细节在条款而非金额:深度求索被归类为「与发行人具有战略合作关系或长期合作愿景的大型企业」,属产业投资而非财务投资,且锁定期长达 36 个月,远高于多数产业投资者的 12 个月,是本次配售中锁定期最长的机构之一。宇树公告披露了三项合作方向:面向通用人工智能的联合研发;深度求索开展具身业务时同等条件下优先采购宇树高性能通用机器人;宇树调用大模型时同等条件下优先选择深度求索,后者并提供模型架构方案、智算集群建设、数据中心运营等技术支持。随公告一并曝光的还有 DeepSeek 股权结构——梁文锋直接持股 31.0078%,通过宁波程恩、杭州程砺两家合伙企业控制 68.7129%,合计控制 99.7207%,为绝对实际控制人。
为何值得关注:
这是「大脑」与「身体」在股权层面的第一次硬绑定。过去两年模型公司和机器人公司互相站台的发布会不少,但多停留在联合 demo 层面,散场即结束。36 个月锁定期是个强信号:它超过了绝大多数财务退出窗口,意味着 DeepSeek 押的不是宇树上市后的股价波动,而是具身智能产业化的完整周期。对 DeepSeek 而言,纯模型侧竞争已趋白热化,机器人是少数还能吃到 Scaling 红利的落地场景;对宇树而言,硬件本体的领先正被快速追平,真正的护城河要靠「大脑」补齐。值得玩味的是「同等条件下优先」这种表述——它有约束力,但也留足弹性,说明双方都清楚生态绑定与技术自主之间的分寸。
2. 三家国产公司联手冲刺 100 万小时具身数据,瞄准行业存量两倍
事件内容:
刚拿下仿真、真机双 SOTA 的黎曼动力,联合光轮智能与诺亦腾机器人共建具身智能数据底座,把长期分散的采集、仿真、训练、评测接成一条闭环流水线。黎曼动力立下 flag:到 2026 年底完成 100 万小时机器人训练数据采集,力争成为全球首个突破该规模的企业。这个数字的分量在于对照系——据亿欧智库估算,当前全球高质量具身交互数据总量仅约 50 万小时,其瞄准的是现有行业存量的两倍。此前黎曼动力已用 23.2 万小时数据训练出 Riemann-1.0,初步验证技术路线。横向对比更见差距:Physical Intelligence 训练 π0 用了超 1 万小时;英伟达最新 GR00T 1.7 公开披露的真实示教、人类第一视角与仿真数据合计约 4 万小时;谷歌 DeepMind 联合全球 20 多家机构,才凑出覆盖 22 种本体的 100 多万条轨迹。三方分工明确:诺亦腾靠动捕(全球 70% 市场份额)把人类动作翻译成机器人教材,光轮智能以「求解—测量—生成」仿真平台批量合成数据,黎曼动力做模型侧的需求牵引。
为何值得关注:
具身智能迟迟没等来 Scaling 时刻,卡点已被公认为数据——但这条新闻的真正看点不是「凑数」,而是闭环。此前的困境是采集方不知道模型缺什么,模型公司无力独自包办真机与仿真,仿真平台产出的数据又缺乏真机验证,结果各采各的、各训各的,小时数账面膨胀却难说有多少真正转化成机器人能力。三方联手要做的是让数据生产第一次跟着模型需求转,而非拼一个更大的数据库。100 万小时未必是能力涌现的魔法线,但它第一次让行业有机会在足够大的尺度上验证「机器人到底能不能 Scaling」这道终极命题。动捕、仿真、模型三块能力恰好都在国内产业链手里,这种垂直整合是海外团队短期难以复刻的结构性优势。
3. 卡帕西换基准:《指环王》接替「鹈鹕骑车」,Opus 5 烧 100 万 token 手搓中土
事件内容:
卡帕西宣布 Anthropic 启用全新方式给大模型上强度——用《指环王》取代此前风靡的「鹈鹕骑自行车」SVG 测试。做法是把《指环王》第一章《期待已久的宴会》开头(比尔博宣布 111 岁生日宴会)丢给 Opus 5,指定用 Three.js 现场搓出一整个可在浏览器实时运行的中土世界。模型需要先读懂文字,再用多边形拼出人物、建筑、道具,逐个放进 xyz 坐标系,并用代码定义摄像机、灯光、动画与物体交互。代价是 100 万 token、2 小时、5500 行代码。成品颇为粗糙,穿模、漂浮频出,网友端出的 DeepSeek V4 Flash 版本更是「全员漂浮」。卡帕西的点评相当中肯:Opus 5 无法真正「进入」自己生成的世界,只能在不同时间点反复截图再慢慢排查问题。他同时提出程序化 3D 与视频生成并非二选一——代码负责分镜与控制骨架,再交给 Video-to-Video 模型补纹理光影。音频部分用了 ElevenLabs,项目已开源。
为何值得关注:
这个基准的巧妙之处在于把「写代码」与「理解世界」焊死:模型不仅要产出语法正确的 5500 行 Three.js,还要在三维空间中维持比例、镜头与叙事连贯——任何空间推理失误都会以穿模的形式直接暴露在画面上,比跑分榜单诚实得多。而卡帕西点出的短板才是真正的行业命题:模型能写游戏,却不会玩自己写的游戏。缺失的是视觉闭环——看不懂视频、无法自查运行结果,就只能靠人类截图当眼睛。这也是当前 Coding Agent 的通病:能生成,不能验证。谁先补上「跑一遍再改」的闭环,谁就握住了长程编程任务的钥匙。
4. Qwen3.8-Max 以 55.4 分登顶 Artificial Analysis 智能体榜,终结欧美垄断
事件内容:
Artificial Analysis 于 8 月 6 日公布新一期榜单,阿里 Qwen3.8-Max 在智能体能力(Agentic Index)排行榜中超越 Claude Opus 5 与 GPT-5.6,位列全球第一。Agentic 能力衡量的是模型调用工具解决复杂问题的潜力,被视为 AI 落地各专业场景的关键指标。该领域冠军长期由 Claude、GPT 两家垄断,此前中国模型的最好成绩是 Kimi K3 的 50.1 分,Qwen3.8 此次以 55.4 分夺冠,较前者提升逾 5 分。需要说明的是,该消息由阿里巴巴供稿、量子位获授权转载,观点归原作者所有。
为何值得关注:
智能体能力是所有榜单里最难刷、也最贴近真实生产力的一项——它考的不是单轮问答的漂亮话,而是多轮工具调用中的规划、纠错与状态维持,任何一环崩掉整个任务链就断了。中国模型此前在语言、数学、代码单项上多次登顶,但 Agentic 一直是硬骨头,因为它高度依赖后训练阶段的工具使用数据与长程 RL 工程能力,无法靠堆参数速成。55.4 分的意义不在数字本身,而在于它落在 AI Coding 与自动化工作流的正中央:编程助手、企业流程 Agent 这类真金白银的场景,选型时看的正是这项。当然,供稿转载的性质决定了这条需要打个折扣看——第三方复测与真实业务落地表现,才是更硬的裁判。
5. Naïve 融资 2850 万美元:把 Vibe Coding 从写代码推进到「开公司」
事件内容:
初创公司 Naïve 完成 2850 万美元融资,主张把 vibe coding 再往前推一步——其基础设施声称可以自动化「创办并运营一家公司」的绝大部分杂活(grunt work)。换言之,产品边界不再局限于生成应用代码,而是覆盖公司注册、合规、财务、运营流程搭建等一系列过去必须由人肉在多个 SaaS 后台之间来回搬运的事务性工作。同日另有两笔相关交易:Klaviyo 收购连续创业者 Elias Torres 的 Agency,后者以 CPO 身份加入主导其 AI 智能体业务;Mirendil 与 Google Cloud 签下超 1 亿美元协议,扩充算力以研究可自我改进的 AI 系统。
为何值得关注:
Vibe Coding 的第一波红利是「不会写代码的人也能做出应用」,而 Naïve 押的是第二波:做出应用之后的那一堆破事,同样可以被 Agent 吃掉。商业逻辑比纯代码生成更扎实——代码生成面对的是 Cursor、Copilot、Claude Code 的血海竞争,而公司运营杂活散落在几十个垂直 SaaS 里,长期缺乏统一入口,正是 Agent 横向整合的理想土壤。风险也直白:这类任务容错率远低于写代码。代码错了能回滚,报税报错、合同签错是要负法律责任的。这 2850 万买的是一张验证「Agent 能否承担有法律后果动作」的门票,恰好呼应同日 arXiv 那批「何时可安全行动」的研究。
6. Google Maps 智能体化:从导航工具变成能点餐订房的执行助手
事件内容:
谷歌为 Google Maps 加入一系列 agentic 功能,用户可直接在地图内完成餐饮点单与酒店预订等操作,无需跳转第三方应用。TechCrunch 指出,此举反映谷歌意在把 Maps 从一个导航工具,转变为能够帮助用户完成真实世界任务的助手。这与谷歌近期整体产品线的智能体化节奏一致,公司也将于 8 月 12 日举办 Made by Google 硬件发布会。
为何值得关注:
地图是少数天然具备「意图—位置—交易」完整链路的产品:用户搜索一家餐厅时,目的往往不是看它在哪,而是要吃上这顿饭。把 Agent 塞进这个链路,转化路径被压缩到极致。更值得注意的是它对流量格局的冲击——过去 Maps 把用户导向 OpenTable、Booking 这类平台,现在则可能在自家界面内闭环完成交易,中间层平台的议价能力将被显著削弱。这也是 Agent 商业化最现实的一条路径:不做通用助手,而是在已有高频入口里就地完成动作。比起还在找场景的独立 Agent 产品,坐拥十亿级用户的地图应用只需要加一个按钮。
7. arXiv 智能体可靠性三连:当 Agent 的自我报告本身就不可信
事件内容:
cs.AI 同日集中出现一批直指长程智能体可靠性的工作。The LLM Proposes, the Executive Disposes(arXiv:2608.04066)提出一个尖锐问题:当智能体的状态与自我报告恰恰是最不可信的东西时,如何验证它?其方案是让验证成为结构性的而非事后的——由一个确定性的 Executive 独占所有信念(belief),语言模型只能提交带类型的提案,从而把「承诺漂移」与「绑定漂移」两类失效解耦。SafeCommit(arXiv:2608.04289)处理另一核心失效模式「过早承诺」:智能体在尚未确认自身记忆是陈旧、冲突、残缺还是已被污染时,就采取了有外部副作用的行动,论文将其形式化并给出何时「可以安全行动」的认证方法。FinPerMA(arXiv:2608.04095)则考察 LLM 智能体能否在长周期内维护并更新个性化用户模型,场景锁定金融顾问这类高风险领域。同批还有 FinProBench、MatrAIx 等评测基础设施工作。
为何值得关注:
这批论文的共同底色是:关注点正从「Agent 能不能做到」转向「Agent 什么时候不该动手」。当智能体开始拥有持久记忆和真实副作用(发邮件、改代码、下订单),最大的风险不再是能力不足,而是它在信息不足时表现得过于自信。把信念状态从语言模型手里收走、交给确定性执行器托管,是个务实到近乎保守的架构选择,本质上承认了「不要相信模型对自己的描述」。这个思路对做 Coding Agent 的团队尤其有参考价值——代码库状态、依赖版本、上一步是否真的执行成功,恰恰都是模型最容易记错、也最容易一错到底的地方。
8. OpenAI 硬件轮廓浮现:冰球大小无屏智能音箱,售价 300–400 美元
事件内容:
据彭博社 Mark Gurman 报道,OpenAI 与前苹果设计师 Jony Ive 合作的首款设备「本质上是一个没有显示屏的智能音箱」——电池供电、甜甜圈造型、体积约与冰球相当,并配有独特的灯光效果。TechCrunch 补充称其售价区间为 300 至 400 美元,预计 2027 年发布。同期 OpenAI 在软件侧动作亦不小:自下周起,ChatGPT 免费版与 Go 档位用户将获得无限量文本对话,此前这两档存在速率限制,同时新增用于复杂查询的 think 按钮。
为何值得关注:
无屏、无摄像头、纯语音——如果爆料属实,这个形态比市场预期保守得多,本质上是把 ChatGPT 装进了一个 Echo 的壳子里,很难解释为何需要 Jony Ive 和数十亿美元的收购。真正的看点或许在于它刻意不做什么:放弃屏幕意味着放弃信息密度,赌的是对话式交互足以承载全部需求,这在多模态大行其道的当下是个逆势判断。另一边,免费档放开无限文本对话的时机也耐人寻味——在推理成本持续下探的背景下,OpenAI 显然认为用户规模的战略价值已超过 token 成本,这与微软近期给 token 上预算的收紧策略形成鲜明对照。一家在抢用户,一家在抠成本,同一条成本曲线上站着两种完全相反的姿势。
每日 09:00 自动更新 | 侧重 AI Coding 与具身智能方向