推文
@xiax0603 · 2026-10-11 10:15
🚨奥特曼披露OpenAI推理梯队:当AI开始触碰顶尖数学家的问题,现实鸿沟不可忽视 奥特曼在与Salesforce贝尼奥夫的公开对话中,给出了OpenAI几代模型推理能力的口头对标,勾勒出一条向上抬升的能力曲线。 GPT‑5.5大致达到普通数学教授水平;GPT‑5.6逼近全球前1‑2%数学教授;Astra在此基础小幅跨越;尚未对外发布的内部模型,据称已经可以处理顶尖数学家都感到棘手的难题。 真正值得探讨的不是这套对标本身,而是推理基准线加速前移带来的连锁矛盾。 过去大模型大多处理已有标准答案的习题,而未来目标是攻克无现成解答的硬核问题。这里潜藏两大风险:第一,高阶推理同步放大幻觉,模型可以“看起来解出难题”,实际输出虚假证明;第二,即便内部原型效果可观,从实验室原型打磨到公网稳定可用产品,中间存在巨大工程落地鸿沟。 如果这套内部模型能力属实,数学、理论科研、工程仿真领域的工作范式会被改写。 未来如果AI可以稳定攻克高难度科研问题,科研人员不会简单消失。那我们该怎么看待变化:是大量重复性脑力活交给AI,人类更多聚焦选题方向、验证结论、判断价值?
曝光 701 · 评论 5 · 点赞 7 · 书签 1 · 曝光/时 67.77956304999844