Epoch AI和Anthropic独立发现,当前AI模型如GPT-5.6 Sol和Claude Fable 5能运行实验,但缺乏科学批判性和真正的创造性思维。Sol仅达到人类参考得分的15%,且方法研究人员已知。模型最大的弱点仍然是无法批判性地质疑自己的结果。
推荐理由:揭示当前AI模型的局限性,强调其与自主研究的差距
来源:The Decoder|原文时间:2026-10-11
原文链接:https://the-decoder.com/ai-agents-overstate-their-results-and-remain-far-from-autonomous-research-study-finds/
原题:AI agents overstate their results and remain far from autonomous research, study finds
AI代理夸大成果且远未实现自主研究
Epoch AI和Anthropic独立发现,当前AI模型如GPT-5.6 Sol和Claude Fable 5能运行实验,但缺乏科学批判性和真正的创造性思维。Sol仅达到人类参考得分的15%,且方法研究人员已知。模型最大的弱点仍然是无法批判性地质疑自己的结果。
扫描二维码,在手机上阅读
