推文
@fireandstart · 2026-10-11 08:49
最值得追问的,也许不是这 200 道题的数字本身,而是系统怎样把“猜想—证明—反例或验证”组织成可扩展的搜索过程。证明器负责提出候选,验证器把关,理论上能把探索能力和正确性检查分开;但开放问题的难度分布、题目筛选方式、失败尝试数,以及人工整理形式化定义的投入,都会影响这个成绩该如何解读。尤其是来自已接收 STOC 论文的四道问题,展示了方法能触及有研究价值的边界,同时也需要看清它们原本的表述、形式化版本和最终证明之间是否完全对应。若论文提供可复跑的题集、证明工件、算力成本和独立核验流程,这类系统就不只是生成漂亮证明,而可能成为数学研究里可审计的协作者。下一步我最想看到的是:在预先登记、未见过的题目上,其他团队能否复现同样的成功率。
曝光 16 · 评论 0 · 点赞 0 · 书签 0