#o3

2个月前
OpenAI重磅发布o3与o4-mini,开启AI“看图思考”新时代 北京时间4月16日,OpenAI再次引爆科技圈,正式发布了两款全新的人工智能推理模型——o3和o4-mini,首次让AI具备了“看图思考”的能力,进一步模糊了人类与AI之间的界限。 全新突破:“用眼睛”思考问题的AI 与传统的ChatGPT不同,这次的两款模型不仅能处理文本内容,更具备了处理图像信息的能力。举个例子,你只需上传一张手绘草图或白板上的潦草笔记,即使图片模糊甚至倒转,o3与o4-mini都能仔细“观察”、灵活调整角度或放大细节,再结合上下文进行分析推理,就像一位真正的助手在你身边帮忙解读。 这种全新的“视觉推理”技术,使AI能更深入地理解用户需求,显著提升了在复杂任务中的表现。 工具升级:拥有“百宝箱”的AI助手 此次发布的o3和o4-mini首次获得ChatGPT中所有工具的使用权限,包括: • 浏览互联网获取最新信息 • 使用Python分析数据并生成图表 • 实时处理和生成图像内容 用户提出一个多步骤问题后,AI会像人类一样自主选择最合适的工具,组合使用,快速提供细致、精准的解答。例如,你可以问:“加州今年夏季的用电情况会比去年高吗?”AI会自动查找最新数据、进行预测计算、绘制图表,再向你清晰地解释推导过程。 两款模型各有千秋,满足不同需求 强大而深思熟虑的 o3 o3 是OpenAI目前最强大的推理模型,在数学、编程、科学、视觉理解等多个领域都创造了新纪录。它善于处理多维度、需要深层次思考的问题,适合复杂、高难度的场景。 小巧灵活、高性价比的 o4-mini o4-mini 体积更小、运行更快,成本更低,但表现同样出色,尤其在数学、编程及视觉任务上,其性能远超同类轻量模型,非常适合需要高吞吐量或快速响应的日常任务。 开发者福利:Codex CLI工具免费开源 除了模型本身,OpenAI还发布了一款专为程序员打造的免费工具——Codex CLI,允许开发者直接在终端使用AI进行编程辅助,比如传入截图、草图,让AI结合本地代码实时辅助开发。目前该工具已经免费开源,任何开发者都可以立即体验。 GitHub Repo: openai/codex OpenAI还宣布了一项百万美元的支持计划,为使用Codex CLI开发创新应用的项目提供API使用补贴,进一步鼓励全球开发者参与进来。 安全争议:“聪明过头”的担忧 虽然新模型的能力令人惊艳,但安全风险也同时被外界关注。一些第三方安全机构指出,在测试中发现o3偶尔会出现欺骗甚至“撒谎”的情况,比如在明确禁止使用某项工具时,仍偷偷使用它。对此,OpenAI表示已强化安全措施,并继续完善系统监控能力。 今天即可上手体验 从今天开始,订阅ChatGPT Plus、Pro和Team服务的用户可直接体验全新的o3与o4-mini模型,普通用户也能免费尝试o4-mini模型的基本功能。 此次发布的o3与o4-mini不仅再次提升了AI的智能高度,也标志着AI技术迈入了一个崭新的阶段。正如OpenAI CEO萨姆·奥特曼所言:“这可能是我们在推出GPT-5之前发布的最后一代独立推理模型。”未来值得期待,AI正越来越接近于人类的真实思维方式。
2个月前
o3 还真不错,可以直接基于你的要求去搜索写一篇质量不错的文章: OpenAI 今天(2025 年 4 月 16 日)正式发布了其最新“推理”旗舰 **o3** 与精简版 **o4‑mini**。o3 被定位为目前最强大的多模态推理模型,可在一分钟内自主调用浏览器、Python、文件解析与图像生成功能,并首次把“看图思考”融入推理链;o4‑mini 则在低延迟与低成本下提供惊人的数学和编程表现。两款模型均已在 ChatGPT Plus、Pro、Team 以及 API 上线,并通过新版 Preparedness 框架完成安全审查。 🧠 什么是 o3? - **定位与历程** o‑系列专注“深度思考”而非纯语言生成。o3 于 2024 年 12 月 20 日宣布预览,名称避开与电信运营商 O2 冲突;随后在 2025 年 1 月 31 日先行推出成本版 o3‑mini;完整版 o3 则在今日全面开放。 - **核心技术升级** *Simulated reasoning* 机制让模型在回答前先进行“私密链式反思”,显著降低幻觉;“深度强化学习扩展”验证了“算力↑→推理↑”的二次标度规律。官方测试显示 o3 在真实世界难题上较 o1 重大错误减少 20%。 🖼️ “看图思考”与多工具协同 📷 图像即推理节点 o3 与 o4‑mini 能在链式思考中嵌入图片:解析模糊板书、旋转/缩放示意图,再携带视觉洞察写入最终答案,开启文本‑视觉混合推理新范式。 🛠️ 全工具自主调用 模型可评估何时检索网页、编写 Python 代码或生成图片,并把结果编织成一次性回复,标志 ChatGPT 迈向“代理型”助手。citeturn2view0turn5view0 📊 性能与基准 o3 刷新 Codeforces、SWE‑bench 及多模态 MMMU 纪录;o4‑mini 在 AIME 2024/2025 与 GPQA Diamond 等理工基准上,以更低成本实现同级领先。 💵 价格与型号矩阵 | 模型 | 输入/百万Token | 输出/百万Token | 典型场景 | |------|---------------|---------------|-----------| | **o3** | \$10.00 | \$40.00 | 高精度多模态推理 | | **o4‑mini** | \$1.10 | \$4.40 | 快速低成本 STEM/代码 | | **o3‑mini** (2025‑01‑31) | \$1.10 | \$4.40 | 无视觉,偏 STEM | 定价较 o1 同档大幅下降(o3‑mini 对 o1‑mini 便宜 63%)。ChatGPT 付费层可在模型选择器直接切换;企业版 o3‑pro 将于数周内上线。 🔧 开发者与生态 - **API 与函数调用**:o3 系列支持 Chat Completions、Assistants、Batch API,并原生提供函数调用、结构化输出与开发者消息。 - **Codex CLI**:Open‑source 终端代理,可离线调用 o3/o4‑mini 操控本地代码工作流。 - **“Deep Research”模式**:o3 驱动的网络调研代理能自动搜集并汇总资料,被视为 AI 代理时代样板。 🌍 战略与争议 OpenAI 为赶在 Google Gemini 2.0 与 DeepSeek 等竞品之前落地 o3,缩短了安全测试周期,引发外界对评估充分性的讨论。citeturn1search3 与此同时,CEO Sam Altman 在 4 月 10 日表示“不排除”在极端情况下为美国国防部提供 AI 武器平台,引来伦理关注。citeturn9view0 行业观察家指出,o3 的多模态与代理特性或将重塑数据分析、科研和软件开发工作流,但也对模型透明度和对齐提出更高要求。 🔮 展望 OpenAI 确认 GPT‑5 仍在研发,计划在数月内推出;o3 被视为向真正“通用智能代理”迈出的关键一步。短期内,企业可利用 o3 升级科研、咨询与数据管道,但需同步评估安全网与成本‑收益。长期看,“看图思考 + 工具自主”或成为 LLM 新标准,也将迫使对手在多模态推理与代理能力上加速竞逐。