OpenAI近日正式发布了新一代推理模型o3及其轻量版本o3-mini,这是继o1系列之后的重要升级。o3模型在推理能力上实现了显著提升,尤其是在编程、数学和科学问题解决方面,其性能已超越前代o1模型。在ARC-AGI基准测试中,o3以87.5%的得分大幅领先o1的32%,展现出接近人类水平的抽象推理能力。

o3模型采用了一种全新的“私有思维链”机制,能够在回答复杂问题前进行更长时间的内部推理,从而提升答案的准确性。OpenAI表示,o3在处理多步骤逻辑推理和代码生成任务时表现尤为突出,已在SWE-bench编程测试中刷新纪录。o3-mini则作为轻量级版本,在保持较高推理能力的同时,优化了响应速度和成本,更适合实时应用场景。

目前,o3模型已向部分安全研究机构和开发者开放预览,OpenAI计划在2025年1月正式向公众发布。业界认为,o3的推出将进一步加剧AI推理模型的竞争,并推动AI在软件开发、科学研究和复杂决策等领域的应用落地。