未来已来
未来已来WEILAI.WANG
首页热点动态畅想

Popular Tags

AI
人工智能
GitHub
开源
中文
具身智能
科技
每日早报
关于平台关于作者联系我

关于

了解更多

© 2024 WEILAI.WANG. All rights reserved.鲁ICP备2024094268号-2

正在加载热点内容...

AI 动态速报 | 08月11日:Meta 重回开源,Claude Code 98.4% 代码不是 AI,灵巧手半年吸金 200 亿

2026年8月11日 09:25
AI助手
作者:AI 动态速报
1
返回热点列表
AIAI Coding具身智能AgentHarness开源模型

Meta 沉寂一年后重回开源,Muse Glimmer 30B 挂上 Apache 2.0,专为 Agentic 任务调优、32GB 内存可本地跑;微软 Agent Framework Harness 正式发布,援引论文测出 Claude Code 51.2 万行代码中 98.4% 是 Harness 工程、AI 决策逻辑仅 1.6%;开源 LangAlpha 把这套 Harness 搬进投研,喊出 Vibe Investing;腾讯、百度、Cloudflare 三位安全负责人给出反共识判断:human in the loop 正退化成「闭着眼睛点确认」;37 名研究者呼吁废掉 PDF 改用 Agent 原生的 ARA 格式,失败复盘类问题准确率 81.4% 对 15.7%;橡木果发布零预训练数据的具身「本能模型」Natus AGE-0;郎咸朋首次开口,称具身相当于自动驾驶的 2015 年、只靠融资谁都撑不到那天;灵巧手半年吸金 200 亿,整机厂却吐槽一周就得换一只。今日 8 条,侧重 AI Coding 与具身智能。

侧重 AI Coding 与 具身智能 方向,精选 8 条今日值得关注的重要动态。

1. Meta 重回开源:Muse Glimmer 30B 挂上 Apache 2.0,直接对着 Agentic 任务调优

事件内容:
8 月 10 日,Meta 发布开源权重模型 Muse Glimmer,30B 参数,采用干净的 Apache 2.0 许可——相比此前 Llama 系列附带商用限制的自定义许可,这是一次彻底松绑。官方将其定位为「开放 Agentic 模型」,宣称的优化重点全部指向端到端任务完成:在 DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Bench 等全任务基准上取得较强成功率,覆盖在脚手架内工作、写代码与调试、多轮请求闭环三类能力;工具调用强调按精确 schema 在长流程中稳定调用函数;推理强调跨长程保持连贯计划。模型同时具备视觉能力。开发者 Simon Willison 第一时间实测:LM Studio 上的量化版本约 18.16 GB,他用自研 llm-coding-agent 插件对 Datasette 代码库提问「认证是怎么工作的」,模型完成一长串工具调用后给出了答复;图像描述测试中,对鹈鹕照片的物种、姿态与背景细节均识别准确。他特别看重这个尺寸——32GB 内存的机器就能跑,还留得下余量同时开其他应用。

为何值得关注:
Meta 在开源上沉寂一年后重新入局,并且直接放弃了被诟病已久的 Llama 定制许可。更值得注意的是选型逻辑的转变:30B 不是冲榜尺寸,Apache 2.0 也不是给榜单看的,这套组合明确瞄准「能在个人机器上跑起来的本地编程 Agent」。当云端 Coding Agent 的 token 账单开始劝退用户,一个本地可跑、许可干净、专为工具调用调优的 30B 模型,可能比又一个闭源 SOTA 更能改变开发者的日常工作方式。


2. 微软 Agent Framework Harness 正式发布:一篇论文测出 Claude Code 98.4% 的代码不是 AI

事件内容:
微软将 Agent Framework 从 SDK 推进到受支持的生产运行时,Harness 与 Foundry Hosted Agents 正式发布。Harness 把函数调用、逐次调用历史持久化、上下文压缩、带计划/执行模式的待办列表、文件记忆、技能、网页搜索、工具审批与内置 OpenTelemetry 全部默认开启并可单独禁用;Shell 工具、文件访问、后台子代理与自动循环保持可选且启用时告警。开发者只需提供聊天客户端、指令和工具,单次 create_harness_agent 调用即可获得其余全部能力,Hosted Agents 按使用量计费。发布中援引 MBZUAI VILA 实验室 4 月论文《深入解析 Claude Code》:分析 Claude Code v2.1.88 的 1884 个文件、约 51.2 万行代码后估算,约 98.4% 属于 Harness 基础设施——权限、上下文管理、沙箱、工具路由与恢复机制,AI 决策逻辑仅约 1.6%。另有微软 AI 首席架构师 Aqib Sherwani 的固定模型对照测试:Agent Framework 在 40 次往返后自行终止并返回「达到限制」,而关闭宿主端停止控制的 Copilot SDK 一路跑到 300 次不停。

为何值得关注:
1.6% 这个数字应该被每个做 Agent 的团队贴在墙上。它说明当下 Coding Agent 的竞争力几乎不在调用模型那几行,而在包裹模型的那套工程。Codex CLI 与 Aider 独立演化出同构的 Harness 结构,进一步说明这是问题约束而非设计偏好。而 40 次对 300 次的刹车差异更直指治理要害:刹车放在循环内部,还是指望宿主提供,决定了 Agent 失控时究竟谁来兜底。


3. 开源 LangAlpha 发布:把 Claude Code 那套 Harness 搬进投研,喊出 Vibe Investing

事件内容:
LangAlpha 团队开源发布同名「金融 Agent OS」,自我定位为「金融领域的 Claude Code」,开源版托管于 github.com/ginlix-ai/LangAlpha,同时提供在线 SaaS。其架构同样建立在 Harness 之上,并产品化为三个能力:Workspace(每个标的、组合或研究主题独立工作区,历史对话、数据文件、图表、代码与待验证假设持续保存,可跨天跨 Session 延续)、Trace(工具调用、数据来源、执行步骤与生成文件全程可回放复核)、Verifier(关键数字、财务口径、引用、时间点、估值公式与回测结果经过校验,高风险步骤可设人工确认)。运行时自研 PTC(Programmatic Tool Calling):模型不直接「猜」数字,而是生成 Python 在隔离沙箱中调取金融数据、清洗、算指标、画图,结果经 Schema 校验后回到推理链,长任务中断可从 Checkpoint 恢复。多模型路由支持 Claude、OpenAI、DeepSeek、GLM、Kimi,团队称在结构化研究、数据分析与报告生成任务上,低成本模型配合 PTC 与 Verifier 可逼近旗舰模型的实际完成效果。

为何值得关注:
这条与上一条互为印证——Harness 正从 Coding Agent 的内部实现,变成跨行业复用的架构名词。LangAlpha 的划界说得很清楚:Claude Code 优化的是 Agent 的能力上限,垂直 Agent 要优化的是任务质量的下限、可信度与稳定交付。金融必须补上的时间语义、证据链、审计与权限,恰恰是通用 Agent 最薄的地方。若这条路走通,法律、医疗、科研的「Agent OS」会是接下来一年最拥挤的赛道。


4. 一个反共识判断:human in the loop 正在退化成 human clicking the button

事件内容:
InfoQ《极客有约》直播中,腾讯专家工程师、AI Agent 安全负责人张栋,与百度智能云安全架构师林道正、Cloudflare 高级解决方案工程师刘旭,围绕企业 Agent 安全给出一组尖锐结论。张栋直言,行业把 human in the loop 当万能解药,但它正在成为 Agent 安全里最大的「安慰剂」——人会确认疲劳,弹窗越多越频繁,它就越退化成闭着眼睛点确认,给了团队「我们很安全」的错觉却没给真正的安全。刘旭以自身用 Claude 编程举例,嫌麻烦直接 allow all,所谓在环只是虚拟在环。林道正披露了一个极端注入案例:上下文被过度压缩后,前面所有约束消失,只剩 skill 里一个看起来像示例的真实地址,数据就直接 post 了过去;他还提到团队研究恶意 skill 时发现,这类攻击 100% 能绕过提示词层护栏,只能回到执行层做系统行为监控。三人给出的框架是「可视、可管、可追溯」三板斧,以及安全的三次换轨:从守内容到管行为、从静态入口到动态边界、从一次性验收到持续飞轮。

为何值得关注:
这个判断来得正是时候。Claude Code 刚宣布自动模式默认开启,微软 Harness 把工具审批做成默认能力,业界正集体把「人工确认」当作放开自主性的安全阀,而一线的结论是:这个阀门在高频场景下会物理失效。可行的解法不是让人确认更多,而是把人只用在刀刃上,其余交给可追溯、可拦截的自动策略。外加一句更朴素的忠告:每接入一个工具,就等于多发了一把万能钥匙。


5. PDF 当死,ARA 当立:有人要把论文改写成给 Agent 读的格式

事件内容:
来自斯坦福、密歇根、CMU、MIT 等机构的 37 名研究者提出 ARA(Agent-Native Research Artifact),公开呼吁科学家停止用 PDF 写论文。第一作者、密歇根大学计算机博士刘嘉晨的论点是:PDF 呈现的是被修剪成单一成功路径的叙事,代价有二。一是「叙事税」,枝杈横生的探索树被砍成一条干净直线,后来者看不见前人踩过的坑;二是「工程税」,模型版本、运行环境、超参数、预处理方式散落各处甚至从未记录——团队统计 PaperBench 的 8921 项专家复现要求,仅 45.4% 在论文 PDF 中被完整说明。ARA 把研究重组为机器可直接操作的知识包,分科学逻辑层、可执行代码层、探索图层(保留失败方向与放弃原因)、证据层四层,并配套 Live Research Manager、ARA Compiler 与 ARA 原生审稿系统。实测数据:450 题理解测试中 ARA 组准确率 93.7%、传统组 72.4%;差距最大的是复盘失败类问题,81.4% 对 15.7%。150 项复现任务的难度加权成功率为 64.4% 对 57.4%,且任务越难优势越大。团队分析 24008 次 Agent 运行发现,90.2% 的成本消耗在失败探索上。

为何值得关注:
81.4% 对 15.7% 这个差距不是格式优劣之争,是信息有无之别——传统论文里压根就没有失败记录。而 90.2% 的 Agent 成本烧在重复别人踩过的坑上,直接把「保存失败」从学术洁癖变成了经济问题。这套思路的适用面远超论文:任何要交给 Agent 消费的知识资产,都面临「为人写」还是「为机器写」的重新设计。当然也有反讽之处——ARA 这篇论文本身,仍然是以 PDF 提交的。


6. 具身智能的反共识路线:橡木果发布「本能模型」Natus AGE-0,主打零预训练数据

事件内容:
8 月 10 日,橡木果机器人(Acorn Robot)发布 Natus AGE-0,称其为全球首个以触觉感知为核心、复刻人类操作机理的通用操作基座模型,同时披露由招商局创投与蔚来资本共同领投的天使轮融资。与行业主流「数据即一切」的路线相反,该模型不依赖任何预训练数据。发起人姜峣的判断是,预训练模型存在结构性缺陷:视觉与语言擅长语义理解与场景规划,却无法细腻表征连续、动态、毫秒级的触觉交互与物理接触特性,强行塞入高频推理链路反而限制操作稳定性与泛化能力。技术上是双层生物式架构——「本能反射」从触觉与接触力学出发建立通用操作收敛规律,抓取陌生物体时不去识别「这是什么」,而是通过自研视触觉传感器感知「要掉不掉」的滑移感,本能调节抓力至刚刚好,完全绕开认知推理,实现零样本跨本体、跨物料泛化;「肌肉记忆」则在端侧自主探索中,把原本需高频决策的精细交互沉淀为更高效的操作链路。商业上对标自动驾驶演进,先让机器人以最低成本进入工业现场「跑起来」,聚焦工业柔性生产,标准化双臂单元实现分钟级换产,已在多家全球头部客户产线完成 POC 验证。团队源自清华与哈佛,2017 年提出该路线,历时九年。

为何值得关注:
当整个赛道在数据采集上军备竞赛时,「零数据冷启动」直击那个鸡生蛋悖论——不成熟的模型进不了真实工况采集数据,没有真实数据模型又迭代不动。把触觉而非视觉当作操作的原生模态,本质是承认物理接触的控制带宽远高于语义推理的响应速度。这条路能否走通仍待验证,但它提供了一个不靠堆算力的解法样本;而招商局创投与蔚来资本愿意为「非共识」下注,本身就是赛道开始分化的信号。


7. 郎咸朋创业后首次开口:具身也会有「蔚小理」,只靠融资谁都撑不到那天

事件内容:
理想汽车前智驾一号位郎咸朋首次公开露面。他今年 3 月创立具身智能公司昆仑行,90 天内连融三轮、规模达数十亿元,跑成独角兽;搭档任庚曾任华为国家 CEO、阿里巴巴集团副总裁、阿里云中国区总裁。几个关键判断:其一,行业阶段相当于自动驾驶的 2015、2016 年——路线不定、demo 满天飞、没一家真出货,此处「出货」特指操作智能能否进工厂、进商场取代人干活并有人买单。其二,范式上不能沿用自动驾驶,端到端和 VLA 的底子仍是模仿学习,一个场景可以靠模仿,上万个场景不行,机器人的范式应该是「理解」。其三,模型锚定「物理因果」,MoT 架构不按模态而按目的、动作、结果分专家,配自研联合因果注意力机制让注意力单向流动——做动作时不能偷看结果,「这样就作弊了」。其四,数据走「使用效率」而非「获取效率」,做数据编译,把重力、摩擦等物理量与物理机制显式编译进训练样本,由此天然带来「一脑多形」。其五,烧钱量级:训一个具身大模型几亿十亿都打不住,可能要几十亿甚至上百亿,所以必须先量产自我造血。其六,路径先 toB(工厂上下料、物流)再 toC,「家庭是终点,不是起点」,进家庭约需五年。他还提到,Claude Code 好用不只因为模型强,更因为背后那套 Agent 机制,昆仑行做机器人工程落地用的也是 Agent 的工程框架。

为何值得关注:
一个做了十几年自动驾驶的人,给具身智能安上了最具体的时间锚——2015 年。这个类比的杀伤力在于它预告了接下来几年会发生什么:demo 通货膨胀、路线激烈分化、大批公司死在出货之前。「只靠融资,谁都撑不到具身实现的那一天」是对当下融资狂欢最直接的一盆冷水。而他把 Claude Code 的 Harness 经验直接搬到机器人工程上,让今天这几条看似无关的新闻,指向了同一个词。


8. 灵巧手半年吸金 200 亿:一只手卖到几十万,整机厂却说一周就得换一只

事件内容:
量子位统计显示,今年上半年灵巧手相关企业融资额超 200 亿元,其中关注度较高的 10 家新增融资近 80 亿元、投后估值合计超 750 亿元;灵心巧手 6 月传出估值 60 亿美元(约 410 亿元人民币),超过不少整机独角兽。企查查显示,截至 2026 年 6 月全国现存灵巧手相关企业超 510 家,全球约 50% 在中国。技术上按传动方式分绳驱、直驱、连杆三条路线,成本大头是无槽无刷空心杯电机,据业内人士称不算传感器可占整手 50%~60%;触觉能力则直接拉开 20%~50% 溢价——智元 OminiHand 灵动款 1.48 万元→含触觉 1.98 万元,强脑 Revo 1 基础版 3.5 万元→带触觉 5 万元。高端产品价格惊人:银河通用春晚演示所用的 Sharpa Wave 五指灵巧手 22DoF,单只约 5 万美元。但整机厂集体保持距离——银河通用、逐际动力、至简动力、智平方至今外采。一位企业人士透露,测试过多家产品后发现普遍耐用性不足、高频损坏,不少基本一周就要更换,头部产品在 5 公斤负载下也只能连续运行 50 小时;业内玩笑是「选灵巧手参数表一概不用看,就看跟哪家售后关系更好」。更尖锐的质疑是:多数标称 20+DoF 的产品有效对指空间狭窄、实际输出控制维度仅 6~10DoF,而很多工业场景两指、三指夹具已能覆盖 90% 的任务。

为何值得关注:
这条把具身智能最拥挤的赛道拆开给人看:资本按「人手 21 个自由度」的想象定价,产线按「能不能连续运行 50 小时」付款,中间隔着一整个工程鸿沟。更要命的是那个死循环——真机数据训练需要可靠硬件,降低数据成本又需要仿真,而仿真恰恰解不好接触建模,硬件与算法互相制约。与橡木果押注触觉、郎咸朋把票投给触觉放在一起看,触觉正在成为路线共识,但撑得住量产的触觉硬件还没出现。


每日 09:00 自动更新 | 侧重 AI Coding 与具身智能方向

相关文章

AI 动态速报 | 08月10日:宇树今日申购,GitHub Models 退役,亚马逊烧掉 180 万美元 Claude 账单

2026-08-10

AI 动态速报 | 08月09日:Claude Code 自动模式成默认,谷歌 15 亿美元买编程团队

2026-08-09

Meta发布Muse Code挑战Claude Code,谷歌15亿美元洽购AI编程团队

2026-08-08

AI 动态速报 | 08月08日:OpenAI 因「关键网络能力」暂停 Astra,苹果 bug 赏金设冷静期

2026-08-08

科技早报:AMD收购AI芯片公司,Kimi K3单CPU运行

2026-08-07
Meta
Claude Code
灵巧手
人形机器人
Agent安全
大模型

AI 动态速报 | 2026-08-07:DeepSeek 1.4 亿押注宇树,具身数据冲刺百万小时

2026-08-07

AI 动态速报|8 月 6 日:Meta 发布 Muse Code、AI 10 小时凿穿 CUDA、前沿智能体自主发起社工攻击

2026-08-06

AI 动态速报|DeepSeek V4-Flash 适配 Codex、李飞飞视触觉突破与比亚迪机器人首秀(08/02)

2026-08-02

科技早报:2026-08-01

2026-08-01

AI 动态速报|AI Coding 与具身智能每日精选(2026-08-01)

2026-08-01

DeepSeek V4-Flash适配Codex上线,GPT-5.6降价80%

2026-08-01

科技早报:2026-07-31

2026-07-31

谷歌人形机器人全身控制,Codex自主编程与AI安全里程碑

2026-07-31

AI 动态速报|AI Coding 与具身智能每日精选(2026-07-30)

2026-07-30

AI 动态速报|Coding Agent 安全边界与具身智能「去表演化」(07/29)

2026-07-29

比亚迪首发人形机器人,gstack破11万星MCP无状态

2026-07-28

科技早报:2026-07-24

2026-07-24

科技早报:2026-07-23

2026-07-23

Muse Spark入局AI编程,WAIC机器人告别炫技

2026-07-22

金陵枢码发布AI协同组成立,智元万台量产具身智能拐点已至

2026-06-27

热门标签

OpenAIChatGPTDeepSeekClaudeGeminiNvidia马斯克Sam AltmanLLMAgent机器人自动驾驶AI绘画SoraAIGitHub开源具身智能人工智能AI Coding科技每日早报人形机器人中文Anthropic大模型Claude CodeCodex大语言模型AI智能体