侧重 AI Coding 与 具身智能 方向,精选 8 条今日值得关注的重要动态。
1. Claude 11 天完成费马大定理完整形式化证明
事件内容:
Anthropic 于 9 月 5 日披露,Claude 在 11 天内端到端完成了费马大定理的计算机形式化证明,生成约 1300 万行 Lean 代码、2.95 万个中间定理。项目由清华姚班校友彭天翼发起,借助 Prove2Me 平台,由数十个 Claude 智能体分工协作——拆分引理、生成证明草稿、交叉校验。这是首个由 LLM Agent 集群完成的重大数学定理完整形式化,整个过程可被机器逐行验证,而非仅给出「看似正确」的自然语言论证。
为何值得关注:
这不是「AI 做题」,而是把形式化验证这种过去极度依赖人类专家、耗时数年的工作,变成了可并行、可校验的 Agent 工程。对软件正确性、智能合约审计、芯片验证等「正确性即生命」的领域是范式级信号:当证明可被机器逐行核验,AI Coding 的边界就从「写代码」扩展到「保证代码正确」。
2. UC Berkeley 开源 CUA-Lite:把 computer-use agent 沙箱砍到 0.9GB
事件内容:
据 9 月 7 日 Vibe Coders 日报,UC Berkeley 团队开源 CUA-Lite,一个面向 computer-use(电脑操作)智能体的统一平台,整合环境、智能体、动作轨迹与强化学习评测。它用仅 0.9GB 的 Docker 容器替换了 OSWorld 上 4.1GB 的虚拟机镜像,沙箱体积下降约 78%,并统一了动作 schema。开发者可在本地跑「一次性」执行容器,无需被重型 VM 拖垮内存。
为何值得关注:
Computer-use agent 一直是「重、慢、贵」的代名词,重型虚拟机让普通工作站难以承受。CUA-Lite 把执行环境轻量化、标准化,意味着桌面自动化 agent 能真正下沉到个人开发者的笔记本——这是 Agent 从 Demo 走向本地可编程基础设施的关键一步。
3. Meta FAIR 推出 AI Research Preference Models:多智能体方案先打分再执行
事件内容:
Meta FAIR 联合牛津、UCL 提出 AI Research Preference Models(RPMs):用一个冻结的语言模型「裁判」,在执行前对最多 15 个候选实验方案打分排序,只挑出最优者执行。在 AIRS-Bench 上,该方法把归一化得分从 0.684 提升到 0.729,并把原本 24 小时的基线与耗时压缩到约 15 小时。
为何值得关注:
多智能体循环最怕「空转」——冗余代码改动、API 额度耗尽、token 预算烧光。RPM 的思路是在真正消耗算力前先用评估器过滤低置信方案。这对所有跑 Agent 管道的团队都是可移植的工程范式:在触发代码生成前先给候选计划打分,能大幅省 token、降成本、提吞吐。
4. Anthropic 开源商家 Agent 施工手册 commerce-agents
事件内容:
9 月初,Anthropic 在 GitHub 开源商家 Agent 施工手册(anthropics/commerce-agents,Apache-2.0),包含「购物」与「商家」两个可运行 Agent,覆盖零售、旅游、电信、票务四大行业,开箱即跑,并配套 Claude Code 插件。手册聚焦于把「会对话的客服」升级为「能下单、能改签、能查库存」的真实业务 Agent。
为何值得关注:
这是大厂首次把垂直行业的 Agent 落地范式以开源、可运行的形式摊开。对中小团队而言,与其从零设计 Agent 流程,不如直接借鉴这套「施工手册」——它也折射出趋势:Agent 的竞争正从模型参数转向「可运行的行业工作流」与生态,谁先把最佳实践开源,谁就更容易成为事实标准。
5. 2026 世界机器人大会闭幕:具身智能进入规模化落地关键期
事件内容:
9 月 7 日闭幕的 2026 世界机器人大会上,中国电子学会理事长徐晓兰指出,具身智能产品正从「小批量试用」转向「大规模落地」的关键拐点。现场 373 家企业展出 3000 余款产品、首发 311 件;数据显示,2026 年上半年中国人形机器人出货量已超 4 万台,全球占比进一步提升至 97%。机器人从叠衣、捡垃圾到交警执勤、煮面炒菜,场景持续向真实生活渗透。
为何值得关注:
97% 的全球占比,意味着中国人形机器人已在「量产 + 供应链」上形成压倒性身位。关键不在单台炫技,而在「规模化落地窗口」被正式确认——当出货量级起来,成本曲线、零部件国产化、场景数据飞轮会同时加速,具身智能正从展会走向产线与家庭。
6. 世界人形机器人运动会发布产业标准体系指南与 2500 小时数据集
事件内容:
第二届世界人形机器人运动会期间,官方发布《国家人形机器人产业标准体系建设指南(2026 版)(征求意见稿)》,覆盖基础共性、类脑与智算、肢体部组件、整机系统、应用、安全伦理六大板块;闭幕式同步放出总时长超 2500 小时的全量数据集。结合今年 4 月我国牵头立项的具身智能全球首项国际标准《人形机器人数据集》,行业正用「通用语言」替代此前的「参数自说自话」。
为何值得关注:
过去各家机器人性能无法横向比对,是产业最大堵点。以「赛事规则 + 数据集 + 国际标准」三位一体卡位,中国正把先发优势固化为生态话语权。数据开放与基准统一,意味着竞争从单机性能延伸到标准与生态——这比破纪录更具战略纵深。
7. 广东「十骏」具身智能展:乐聚 Kuavo 5G-A 人形、逐际动力 LimX Luna 亮相
事件内容:
9 月 4—5 日,第二十一届中博会具身智能展区,近 70 家企业参展,广东十家整机企业以「广东十骏」组团亮相:乐聚带来全球首款 5G-A 人形机器人 Kuavo(夸父),身高约 1.73 米、奔跑超 7km/h;逐际动力展出全尺寸交互机器人 LimX Luna,27 个自由度搭配自研运控引擎,可完成跳跃、一字马等高难度动作;智平方通用机器人已在汽车、半导体产线规模化落地。
为何值得关注:
广东以全国最完整的具身智能产业链配套(核心零部件到整机、算法到应用)为底气,把「十家差异化技术路径」摆在同一舞台,呈现的是产业方阵而非单点突破。当整机企业各自找到场景(产线、巡检、服务),具身智能的竞争就已从「能不能动」转向「在哪上岗」。
8. 北京亦庄:天工 Omni 与具身多模态大模型 Pelican-Unify 1.0 发布
事件内容:
2026 世界机器人大会上,北京亦庄 20 余家企业携近百款新品亮相。北京人形机器人创新中心首发天工 Omni,现场完成梅花桩、上下楼梯、匍匐爬行等挑战,并同步发布具身多模态大模型 Pelican-Unify 1.0;星海图演示 G0.5 具身基础模型驱动机器人在京东前置仓自主完成拣选、导航、打包;云迹煮面机器人、京东骑行机器马等新奇特展品集中首发。亦庄已聚集 300 余家相关企业,产业链规模超 200 亿元。
为何值得关注:
Pelican-Unify 1.0 代表具身智能从「功能拼凑」迈向「协同进化」——大模型与本体、真实场景深度融合。当「大脑」与「身体」同步成熟,机器人就能从演示走向真实作业(前置仓、酒店、家庭)。亦庄 200 亿产业链的规模效应,正是中国具身智能「以产促智」路径的缩影。
每日 09:00 自动更新 | 侧重 AI Coding 与具身智能方向