AI models flub these intelligence tests. Can you fare any better?
GPT-4在律师资格考试中排名前10%,却在简单的SAT数学题上犯错。Claude能够流畅解释量子力学,却在"三兄弟分遗产"的逻辑题中陷入困境。这些测试失败,正在动摇人们对人工智能"智能"的理解。 2024年初,MIT Technology Review发布了一项专题报道,系统梳理了当前主流大语言模型在各类智力测试中的表现。结果令人困惑:这些被称为"最强大语言模型"的AI系统,在某些领域展现出超