推文
@mylifcc · 2026-10-11 21:01
OpenAI 刚披露了一个相当离谱的工程案例。 仅用 2 名工程师 + Codex + GPT-5.5,就把 ChatGPT 底层一个核心存储服务从 Python 完整重写成了 Rust。 结果: CPU 效率提升 6 倍 内存效率提升 15 倍 平均延迟、尾延迟显著降低 Rust 已承担 95% 的生产请求 更夸张的是,原来的 Python 版本峰值已经能处理每秒 2000 万次请求。 这可能是 AI Coding 改变软件工程成本结构的一个重要案例。 这个服务叫 Habitat。它是 OpenAI 的在线存储访问平台,ChatGPT、Codex 等产品都依赖它。用户登录 ChatGPT、打开对话、读取设置,背后都可能涉及这套系统。 整个平台的规模有多大? 超过 500 PB 数据、每秒超过 7000 万次请求,服务超过 10 亿 ChatGPT 周活跃用户。 有意思的是,OpenAI 早就知道 Python 存在性能瓶颈,却故意等了一年才重写。 因为当时还有更重要的工程问题:asyncio 事件循环延迟、Feature Flag 导致的尾延迟、连接池负载不均衡、突发流量压垮下游数据库 先把架构和稳定性做好,再考虑语言迁移。 Python 版本能撑到 2000 万 RPS,本身就是一次相当成功的工程实践。 值得注意的是这次的重构配置只有2 个工程师,配合 Codex 和 GPT-5.5。 以前这种大型生产系统的跨语言重写,通常需要投入大量人工处理代码迁移、接口适配、测试和验证。 现在 AI Coding 有机会显著压缩其中的实现成本。 另外,OpenAI 没有一开始就抛弃 Python。 他们先用 Python 支撑业务快速增长,解决架构问题,再等性能收益足够明显时迁移 Rust。 这条路线很值得借鉴:早期追求开发效率,中期解决架构瓶颈,规模足够大时再优化运行效率。 以前一套 Python 服务运行稳定,即使 Rust 性能更好,也未必值得花大量人力重写。 现在 Coding Agent 可能让这个经济账发生变化。 未来软件工程的竞争,可能越来越取决于谁能用 Agent 安全地完成大规模重构、测试和迁移。 但前提始终是:性能收益真实,正确性有证据,迁移风险可控。 你觉得未来会出现更多「少数工程师 + Agent」重写大型基础设施的案例吗?
曝光 2555 · 评论 7 · 点赞 16 · 书签 12 · 曝光/时 2077.6681013447583