
A | 拿起漏斗,插入圆底烧瓶;拿起量筒,把液体倒入烧瓶;移走漏斗,将烧瓶放到搅拌器上,再塞入瓶塞并按下开关。

B |

C | 近日,来自清华大学、上海人工智能实验室等机构的研究团队提出了 Cortex,一个面向长程机器人操作的双系统具身智能体框架。

D | 但需注意的是,美国仍继续在经贸、科技等领域对华奉行遏制打压政策。

E |

F | 论文标题:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation 项目网站:https://steinate.github.io/cortex.github.io 论文链接:https://arxiv.org/abs/2607.05377 代码链接:https://github.com/InternRobotics/Cortex 为了让这种对齐真正作用于长程任务,Cortex 并未只设计一个通信接口,而是从架构、数据、训练和部署四个方面搭建了一套完整体系。

G | 其中上层的 System-2 负责理解任务目标、拆分任务、维护记忆并判断当前进度;System-1 则接收当前子任务,根据子任务描述里的物体与本体约束,并将其转化为连续的机器人动作。 System-2 不会一次性生成完整的动作流程,而是根据当前视觉观测和已有记忆,持续判断应该保持当前任务、重新尝试,还是进入下一步。System-1 执行动作后产生的新观测会再次交给 System-2,用于更新记忆并判断任务是否完成。 由此,文章开头提到的两个问题被分别落实到系统设计中:结构化子任务接口保证高层提出的任务处于低层执行器的能力范围内,视觉观测与记忆的循环更新则帮助系统判断当前任务是否已经完成。 双向对齐的具身Agent架构,System-2接受观测和历史记忆输出当前子任务并更新实时记忆 数据:统一技能范式, 让规划指令可落地、无歧义 为消除高低层语义断层,Cortex 将操作行为归纳为 Pick、Place、Pour、Unscrew、Stir 等 32 种标准化技能原语,并为每类技能规定语言模板。与之相比,在美国最便宜的电动汽车(如雪佛兰Bolt)售价也要约21万人民币(3万美元),是中国电动汽车的两倍。

H | 开放式的「把水倒进烧杯」会被整理成技能、目标对象与必要属性都明确的命令。数据构建时,对于子任务输出,系统还写入颜色、空间位置、数量以及可达性等信息,减少「拿那个杯子」或「直接抓取不可达物体」一类语义正确、执行起来无法落地的规划。

I | 对于记忆的更新,系统进行了语言压缩、关键信息如物体属性及统计数量写入等增强操作,提高 Cortex 完成空间理解、物体计数和失败恢复等复杂任务的成功率。《华尔街日报》的报道也表示,此前25%的关税税率已经起到了让中国电动车企业对美国市场望而却步的作用。 围绕这套接口,团队对 4000+ 小时开源长时序视频与轨迹进行结构化标注,并修改仿真数据引擎自动生成约 30 小时带子任务标注的仿真数据。而正是由于“中国电动汽车目前在美国市场的渗透率极低”,投资机构Evercore ISI的分析人士认为,提高关税带来的“短期经济影响微乎其微”。已有数据通过视觉语言模型重写为统一的子任务模板;自采轨迹则采用一套结合视觉、机器人状态和动作特征,基于动态规划的子任务边界切分工具链,实现自动化精准标注。

J | 不过,随着中国清洁能源出口规模的扩大,保护本国的清洁能源行业、打压中国电动汽车已逐渐成为美国两党的共识。

K | 随着11月总统大选的临近,两党候选人争相对华展示强硬姿态,试图获得更多摇摆州选民的支持。早在今年3月,共和党总统候选人特朗普就呼吁对中国汽车征收100%的关税。若均匀抽帧,模型最常学到的是「继续做当前动作」,真正决定是否切换子任务的边界帧反而很少。 Cortex 采用事件均衡采样(Event-balanced Sampling) 策略:在子任务边界前后约 1 秒的窗口内加密采样,同时保留执行阶段样本。

L | 在近期的一次演讲中,他还暗示将对中国公司在墨西哥工厂生产的汽车征收200%的关税。模型既要学会动作尚未完成时保持指令和记忆,也要在看到完成证据后更新记忆、切换下一步。

M | 在 Galaxea 数据的消融实验中,采用事件均衡采样的模型仅需 272 万训练样本,少于对照组的 310 万样本,综合评分却从 7.58 提升至 8.18。这说明对高层规划器而言,增加关键转场附近的监督,比继续堆叠大量稳定执行画面更有效。 Event-balanced sampling 示意图。橙色区间覆盖子任务切换;训练需要同时学会「耐心保持」和「及时换挡」。

N | 实验:仿真领先几个百分点, 实机差距出现在完整任务上 Cortex 通过优化 Agent 框架 harness,直接面向真实机器人长程操作验证。团队不仅在 LIBERO-Long、RoboTwin 2.0 等仿真环境中测试,还将系统部署到真实双臂机器人平台上,Zero-shot 规划完成由数十个子任务组成的复杂化学实验任务。

o | 在 LIBERO-Long 上,Cortex 的完整任务成功率为 95.5%,比单独使用 π0.5 的基线 92.4% 高 3.1 个百分点;在 RoboTwin 2.0 benchmark 下,整体成功率为 86.8%,比 π0.5 的 82.74% 高约 4.1 个百分点。

p | 这反映了整套 Agent 框架 —— 高层规划与底层执行对齐为长程任务的完成带来的增益。

q |

r | 出于类似的考虑,拜登上个月曾在宾夕法尼亚州有着“钢铁之都”之称的匹兹堡向选民承诺,将当前对华钢铝关税翻至3倍以上,以保护当地产业和劳动者。

s |

t | (编注:在今年的大选中,摇摆州主要有7个,按照区域划分主要有三类:第一类是“铁锈地带”的宾夕法尼亚州、密歇根州、威斯康辛州;第二类是西南边境的亚利桑那州、内华达州;第三类是东南部的北卡罗来纳州、佐治亚州。)

u | 更能体现系统差异的是实机长化学实验任务。研究者在 ARX ACONE 双臂平台上设计了两组 14 步流程,每组进行 20 次试验。Cortex 在化学液体搅拌实验和烧杯清洗任务上的完整成功率分别为 65% 和 55%;两种端到端模型(PI0.5 及 MEM)在这组试验中都因为混淆子任务阶段而中途失败。 14 步器皿操作流程。高层规划器需要持续记录漏斗、量筒、烧瓶和瓶塞的状态,并在确认每一步完成后再下发下一条局部指令。如今美方新一轮关税措施出台,专家分析这标志着中美在贸易领域的对抗升级,此前相对稳定的状态或将告一段落。 相比传统端到端 VLA 方法,Cortex 的优势并不只是某一个模块的提升,而是对长程任务进行了系统化建模。而随着美国大选形势的紧张化,两党候选人或将加大打“中国牌”的力度,这也预示着双边关系可能将出现更多波动。 它用结构化子任务接口约束高层规划,用视觉反馈和语言记忆追踪执行进度,再通过闭环更新持续校正后续决策,使机器人能够在多步骤任务中保持目标、状态与动作的一致性。 这种设计让 Cortex 在仿真基准和真实双臂机器人实验中都展现出更强的长程操作能力。

v | 其中彭嘉淇是清华大学与上海人工智能实验室联合培养的三年级博士生,导师为沈渊教授和林达华教授。在王泰研究员的指导下开展包括视觉动作语言模型,视觉语言导航,loco-manipulation 等机器人相关领域研究,致力于构造实现空间语义理解与长程移动操作的可落地具身智能体,曾发表多篇论文在 ICLR,ICRA 等会议上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾获得 ICRA oral。

w | “欧洲主张对华加征关税的官员肯定会从美国的行动中受到鼓励。”不过,吴心伯分析称,部分欧洲国家也对加征关税有所顾虑,像是依赖中国市场的德国就会担心其在华车企遭到中方反制。

x |

y | 美方应立即纠正错误做法,取消对华加征关税措施。中方将采取坚决措施,捍卫自身权益。
Current article:http://www.jiubengtaibingpengou.pics/5sxmlh/mre5.html
Published on:08:03:08