智源:具身人工智能演示进展迅猛,但高基准分数到底能反映多少物理现实…


具身人工智能演示进展迅猛,但高基准分数到底能反映多少物理现实?推出FlagEval-Robo——一个开放的双轨评估套件,连接仿真与现实执行。我们在严格对齐的条件下,系统地对12个领先的开源权重模型做了后续训练和压力测试。下面是我们的发现👇

具身人工智能演示进展迅猛,但高基准分数到底能反映多少物理现实?推出FlagEval-Robo——一个开放的双轨评估套件,连接仿真与现实执行。我们在严格对齐的条件下,系统地对12个领先的开源权重模型做了后续训练和压力测试。下面是我们的发现👇

—— 智源 (@BAAIBeijing) X帖子|2026-09-08T15:00:02+00:00
原帖:https://x.com/BAAIBeijing/status/2097339184675795282



扫描二维码,在手机上阅读

智源:介绍一下AREX,这是北京智源研究院的研究成果。它处理难题不…

Anthropic发布Claude Sonnet 5.5,性能接近Opus 5.5且成本更低

评 论
评论已关闭