侧重 AI Coding 与 具身智能 方向,精选 8 条今日值得关注的重要动态。
1. Cognition(Devin 出品方)传拟以 400 亿美元估值再融资,距上一轮仅数月
事件内容:
据 TechCrunch 8 月 12 日报道,AI 编程公司 Cognition 据称已就在 400 亿美元估值基础上开启新一轮大额融资展开洽谈,距其以 260 亿美元估值募得 10 亿美元仅过去数月。Cognition 旗下产品 Devin 是全球最早定位「AI 软件工程师」的编程智能体,可自主完成需求拆解、编码、测试与 PR 提交。若本轮落地,其估值将在数月内接近翻倍,凸显资本对「能直接产出可交付代码」的 Coding Agent 赛道的热度。
为何值得关注:
估值从 260 亿跳到 400 亿美元、间隔仅数月,说明市场把 Coding Agent 看作比通用聊天更靠近营收的 AI 落点——它直接替代或放大工程师产能,付费意愿明确。但 Devin 自发布起就伴随「实际可用度」争议,估值狂奔的同时,真正的护城河是工程闭环的可靠度而非 demo 效果。这一轮定价,会成赛道估值的锚。
2. Vibe Coding 平台 Lovable 确认 133 亿美元估值,再融 4 亿美元
事件内容:
TechCrunch 8 月 12 日报道,Lovable 确认完成新一轮 4 亿美元融资,估值升至 133 亿美元。公司称其年化经常性收入(ARR)已于 6 月突破 5 亿美元。Lovable 主打「用自然语言一句话生成可上线应用」的 Vibe Coding 体验,面向不会写代码但想把想法变成产品的用户,与 Cursor、Replit 等工具形成「从想法到应用」的不同切入。
为何值得关注:
5 亿美元 ARR 配 133 亿估值,意味着市场愿意为「让人人都能造软件」的叙事付高溢价。Vibe Coding 把软件开发从「写代码」前移到「描述意图」,真正考验的是生成结果的可维护性与可交付性。Lovable 与 Cursor 的路线分野,本质是「自然语言优先」还是「编辑器内增强」之争,谁先跨过「能交付生产级应用」的门槛,谁就拿到下一波入口。
3. AI 代码测试创企 Blacksmith 估值一年涨近 10 倍至 5.5 亿美元
事件内容:
TechCrunch 8 月 12 日报道,AI 代码测试公司 Blacksmith 估值在不到一年内从约 5500 万美元跃升至 5.5 亿美元,增长近 10 倍,公司称同期营收增长超过 10 倍。Blacksmith 用 AI Agent 自动为代码编写并运行测试,定位在「软件验证」环节——即代码写完后、合并前的质量闸门,与 Cursor、Copilot 等「写代码」工具形成上下游互补。
为何值得关注:
写代码被 Agent 加速后,「验证代码」正成为新的瓶颈与价值点。Blacksmith 的十倍估值曲线说明,资本看中的不是又一个补全工具,而是卡在 CI/CD 关键链路上的质量层——它能直接减少回归 bug、节流 QA 人力。当 Coding Agent 产出速度远超人类 review 能力,「自动测试」会从锦上添花变必需基建。
4. arXiv 新框架 SBCO:让规划智能体以「自监督 + 验证器」自我迭代
事件内容:
arXiv(2608.10157)提出 SBCO(Self-Supervised, Verifier-Grounded Harness Optimization),一种面向规划智能体的自监督优化框架。它延续 Darwin Gödel Machine、Huxley Gödel Machine 等「自引用式递归自我改进」思路——让 coding agent 修改自身代码以提升性能,但要求「完成任务所需的能力」与「自我修改所需的能力」对齐。SBCO 用验证器给出的可执行反馈(而非文本模仿)作为学习信号,并对执行外壳(harness)做自监督优化,降低对人工工程投入的依赖。
为何值得关注:
自我改进智能体的关键难题是「改自己容易、改好难」——没有可靠反馈就会越改越偏。SBCO 用验证器锚定「什么算更好」,把自我修改从玄学变成可度量的优化,恰是让 coding agent 真正可持续进化的核心机制。它指向一个方向:未来编程智能体的竞争力,不在单次输出质量,而在能否用反馈闭环持续给自己打补丁。
5. 国产具身智能创全球新纪录:30% 成本跑赢 Figure AI 45% 效率
事件内容:
据量子位 8 月 12 日报道,国产具身智能方案在真实物流场景中创下全球新纪录——具身模型一小时内狂拣 1816 件异形包裹,以约 30% 的成本实现了较 Figure AI 高 45% 的拣选效率,关键在「聪明的具身大脑」。该方案强调以更低的算力与硬件投入,通过更优的感知—决策—执行闭环,在杂乱、非标包裹这类高难任务上拉开差距,而非单纯堆硬件自由度。
为何值得关注:
具身智能的长期痛点是从 demo 到真实工况的掉队——实验室灵巧,现场翻车。这套方案的价值是用「成本/效率比」而非单点炫技说话:用 30% 成本换 45% 效率优势,意味着离可规模化部署更近。它把竞争焦点从「动作像不像人」拉回到「任务单位成本」,而这才是物流、仓储等场景愿意买单的硬指标。
6. 擎羽把「身体」变成具身智能的新变量:从柔性本体走向跨本体基础智能
事件内容:
据量子位 8 月 12 日报道,擎羽(Qingyu)提出以「柔性本体」作为具身智能的新变量——不再只追求刚性关节的高自由度,而是让本体具备可变形、可适配的形态,使同一套智能可在不同身体间延续。报道称其路线是从柔性本体走向「跨本体基础智能」,让任务知识与世界理解脱离特定硬件绑定,从而在不同形态机器人上复用。
为何值得关注:
当下具身智能多在「固定本体 + 专训模型」里打转,换台机器就要重训,泛化成本高。擎羽把「身体本身」当作可设计的变量,押注跨本体基础智能——若世界知识与任务技能能脱离硬件迁移,具身模型的研发范式将类似大模型「一次训练、多端部署」。这条路线能否成立,决定具身智能是「每台机器一个大脑」,还是「一个大脑万千身体」。
7. arXiv 新框架 CHORUS:用 LLM 把芯片验证的测试激励生成推过 SFT+RL 天花板
事件内容:
arXiv(2608.10090)提出 CHORUS(Complementary Experts for High-Coverage Testbench Stimulus Generation),一种面向硬件验证的代码生成后训练框架。芯片验证占据现代芯片设计的大量工作量,高覆盖率的测试激励(testbench stimulus)生成是关键任务。CHORUS 在常规「监督微调 SFT → 强化学习 RL」流水线之外,用互补专家组合把覆盖率推过单一管线上限,靠可执行反馈(仿真是否命中覆盖点)作为比文本模仿更可靠的学习信号。
为何值得关注:
这是 AI Coding 从「写业务代码」深入到「写硬件验证代码」的信号。芯片验证是极度依赖经验、合规性强的工程环节,一旦 LLM 能稳定生成高覆盖测试激励,将直接压缩流片前最烧钱、最耗时的阶段。CHORUS 用「互补专家 + 可执行反馈」绕过 SFT→RL 的天花板,也印证了同一趋势:coding agent 的下一战场是把反馈闭环嵌进高可靠要求的专业工程。
8. arXiv 新框架 CASE:用四门成熟学科给企业级 Agentic AI 立治理架构
事件内容:
arXiv(2608.10153)提出 CASE 框架,认为企业部署自主智能体的速度已超过其治理能力,而主流做法把单一学科(通常是为确定性自动化设计的 DevSecOps)硬套到各种自主层级上。CASE 主张「agentic AI 治理是四个问题而非一个」:用控制论治理单个智能体(意图为设定值、护栏为反馈、评估为观测)、用复杂自适应系统理论治理智能体群体(涌现使单智能体假设失效),并引入其余两门成熟治理科学,分别应对意图对齐与组织边界。
为何值得关注:
当企业把 Agent 接进核心流程,「能不能管住它」比「能不能跑起来」更紧迫。CASE 的清醒在于指出:把 DevOps 那套确定性强管控直接搬给会涌现、会自行决策的多智能体,本就错配。它把治理拆成控制论、复杂系统等多学科,提醒从业者——Agentic AI 的可靠性工程,需要跨控制、组织与安全的组合学科,而非再叠一层 prompt 护栏了事。
每日 09:00 自动更新 | 侧重 AI Coding 与具身智能方向