从 ChatGPT 到 AI Agent:软件开发方式正在发生什么变化
从 ChatGPT 的对话式编程辅助,到能自主调用工具、执行任务的 AI Agent,软件开发的人机协作模式正在经历一次明显的变化。本文结合 Codex 的爆发式增长、MCP 协议的无状态架构升级等 2026 年的最新进展,梳理了这条演进路径,以及这些变化对开发者日常工作的真实影响。
2023 年初 ChatGPT 刚火的时候,大部分开发者都试过用它写代码。用法很直接:描述问题,它生成代码,复制过来改一改,能用就行。遇到报错,把错误信息贴回去,它再给一版修改建议。
跟搜索引擎的区别是,它给的是成品代码,不是一堆链接。
但那时候有一个明显的边界:ChatGPT 只活在对话框里。它不知道当前的项目结构,读不到代码库,更不可能帮你跑测试、查日志、部署服务。能跟它聊技术方案、让它生成代码片段,但所有实际操作——复制、粘贴、调试、部署——都得亲手来。
这更像一个知识面很广的同事,能回答问题,但不帮你干活。
三年过去,情况已经不一样了。
Codex:从被低估到爆发
如果要说这三年里最有代表性的变化,Codex 是一个绕不开的案例。
2025 年 4 月,OpenAI 发布了 Codex CLI。但刚发布的时候,市场反应相当冷淡。技术社区讨论热度不高,开发者更青睐竞品 Claude Code——2026 年第一季度,Claude Code 的周活跃用户达 420 万,而 Codex 不到 100 万。当时 Codex 只有 CLI 一个形态,功能也不完善,对 Windows 支持不到位,编辑文件、联网搜索等基础功能远不如 Claude Code 方便。
转机出现在 2026 年。
2 月,OpenAI 推出了 Codex macOS 桌面应用。3 月推出 Windows 版。4 月 16 日,OpenAI 发布了“Codex for almost everything”重大更新,新增内置浏览器、电脑操作、线程自动化等能力。
从这时开始,Codex 的增长曲线变得陡峭起来。周活跃用户从 200 万到 300 万花了大约 4 周,300 万到 400 万仅用 2 周,400 万到 500 万又花了约 4 周。到 2026 年 6 月,Codex 的周活跃用户已突破 500 万,相比年初增长了 730%。
更值得注意的是,Codex 的用户群体早已不限于开发者。目前大约 20% 的用户是非开发者的知识工作者。
从 Copilot 到 Agent:一个关键的转折
Codex 的爆发不是偶然。它代表了一种根本性的转变:从辅助工具到自主执行者。
GitHub Copilot 让开发者习惯了 AI 辅助写代码,Cursor 率先验证了 AI IDE 路线。但 Copilot 的本质是“给你建议”——你写代码,它补全;你提问,它回答。主动权在人手里。
Agent 不一样。它的核心是替你做事情。
Codex 的官方定位是“智能代理式编码的指挥中心”。它能完成的不只是代码补全,而是端到端的工程任务:功能开发、复杂重构、代码迁移。借助内置的工作树和云端环境,多个 Agent 可以在多个项目之间并行运作,把原本需要数周的工作缩短到几天内完成。
一个典型的场景:你丢给 Codex 一个 GitHub 仓库地址,它能自己完成“写代码 → 跑测试 → 看报错 → 改代码”这套工程师日常循环。它不再只是一个代码生成器,而是一个能独立完成开发任务的智能体。
2026 年 4 月 27 日,Codex 终止了独立产品线,核心能力被整合到 GPT-5.5 主模型中。这标志着 Agent 能力不再是某个单独产品的特性,而正在成为大模型的基础能力。
Agent 的核心能力:工具调用
要让 Agent 替人做事,它必须能调用外部工具。这是 Agent 和纯语言模型的关键区别。
一个纯语言模型的输入输出都是文本。你问它“今天深圳天气怎么样”,它如果训练数据里没有,就只能瞎编。
但如果加上工具调用的能力,流程就变成了:模型决策“我需要调用天气 API”,然后调用工具,拿到结果后再组织成回复。
Function Calling 自 2023 年由 OpenAI 推出以来,已经成为 AI 工具调用的主流方式。模型被给予一个工具注册表,每个工具有名称、描述和参数 Schema,当模型决定采取行动时,会发出一个结构化的请求。
在开发场景里,工具的种类越来越丰富:
- 文件读写
- 命令行执行
- 数据库查询
- 代码编译和测试
- Git 操作
- 浏览器操控
- 图像生成
2026 年 4 月的更新之后,Codex 已经能像人类一样通过视觉识别、点击和输入来自主操控电脑上的各类应用程序。它甚至可以在 Mac 上调度多个应用程序,连接更多生产力工具。这意味着 Agent 不仅能操作命令行和 IDE,还能操作那些没有开放 API 的应用。
此外,Codex 还能调用 gpt-image-1.5 来生成和迭代图像,用于产品设计、界面草图或游戏素材。2026 年 2 月,OpenAI 展示了一个案例:Codex 仅凭一个初始提示,独立使用超过 700 万个 Token,从零构建了一款完整的赛车游戏,同时承担了设计师、开发者和 QA 测试员的角色。
MCP:让工具调用有协议可循
工具调用能力越来越强,但有一个实际问题:每个工具都有自己的接口格式、参数定义、认证方式。如果把 Agent 要调用的每个工具都单独适配一遍,开发和维护成本都不低。
MCP(Model Context Protocol)就是为了解决这个问题而生的。
MCP 由 Anthropic 于 2024 年 11 月推出,目的是标准化 AI 系统连接外部工具、数据源和服务的方式。可以把它理解为 AI 领域的“USB-C 接口”——工具只要实现 MCP 协议,任何支持 MCP 的 Agent 都可以直接使用。
MCP 在 2025 年经历了广泛的兴趣增长,但随后被 Anthropic 推出的 Skills 部分取代。然而,2026 年 7 月 28 日,MCP 发布了最具里程碑意义的一次升级:协议核心正式转向无状态架构。
在此之前,MCP 是基于会话的双向有状态协议,客户端需要先初始化会话才能调用工具。这在本地开发中没问题,但在多服务器生产环境中存在扩展瓶颈——请求往往必须被路由回同一台机器。
新的无状态架构下,每个请求都包含独立处理所需的全部信息,MCP 服务可以像普通云应用一样弹性扩展。正如一位工程师所说:“当基础设施团队问 MCP 服务能否像其他云应用一样弹性扩展时,以前的答案是‘不完全行’,转向无状态架构之后,答案就变成了‘可以’。”
这次升级还引入了多轮往返请求机制、可路由传输头、基于 OAuth 2.1 的授权框架,以及 Python、TypeScript、Go、C# 等语言的 SDK 更新。
与此同时,MCP Apps 也在 2026 年 1 月作为首个官方 MCP 扩展正式发布。它让 AI 模型不再只是“描述你的数据”,而是能“交给你一个可操作的界面”。这意味着 Agent 与工具的交互正在从纯 API 调用走向更丰富的交互形态。
人机协作的新形态
从 ChatGPT 到 Agent,真正变化的不是模型本身的能力(虽然模型确实在变强),而是模型与外部世界的接口方式。
ChatGPT 时期,接口是对话框。人和模型之间隔着复制粘贴。
Agent 时期,接口变成了文件系统、命令行、数据库、API、浏览器,甚至整个电脑。模型可以在真实环境里执行操作。
但这种变化并不意味着“AI 取代开发者”。实际落地中,人在关键环节仍然在做决策:
- 定义任务目标和边界
- 提供必要的上下文(项目规范、业务逻辑)
- 审批高风险操作
- 校验最终产出物的质量
IDC 的数据显示,全球活跃 Agent 数量预计从 2025 年的 2860 万个增长到 2026 年的 7940 万个。但这些 Agent 不是替代人,而是承担起数字员工的角色。
2026 年 7 月,微软在 Visual Studio 更新中加入了 Copilot Agent 预览版,并内置了 .NET 和 Azure 相关的 Agent Skills。GitHub 和 JetBrains 也宣布了更深度的集成,通过 Agent Client Protocol 让 Copilot 能规划、执行和迭代复杂的开发任务。微软还计划在 2026 年内推出一款 Copilot “超级应用”,整合聊天、代码编写和自主智能体功能。
现在处在什么阶段
客观来说,Agent 在日常开发中的成熟度还在快速提升中,但已经不是概念阶段了。
Codex 周活跃 500 万用户、MCP 完成无状态架构升级、主流 IDE 纷纷集成 Agent 能力——这些信号都说明,Agent 正在从实验走向生产。
对开发者来说,重要的不是焦虑“AI 会不会取代我”,而是理解这个变化,找到新的工作方式。
工具变了,做事的方式跟着变。但核心能力——理解系统、定义目标、做技术决策——始终是人的价值所在。