AI系列专题研究:GPT-6 Astra:Computer Use突破,AI从Copilot迈向端到端Agent
请务必阅读正文之后的免责声明及其项下所有内容2026年09月06日GPT-6 Astra:Computer Use突破,AI从Copilot迈向端到端AgentAI系列专题研究行业研究 · 专题报告 传媒·计算机投资评级:优于大市(维持)证券研究报告 | 证券分析师:张衡证券分析师:熊莉联系人:侯睿021-60875160021-61761067zhangheng2@guosen.com.cnxiongli@guosen.com.cnhourui3@guosen.com.cnS0980517060002S09805190300022026年09月07日请务必阅读正文之后的免责声明及其项下所有内容核心要点:从Copilot迈向端到端Agent,AI应用与Inference需求有望进入新阶段➢ GPT-6 Astra能力继续跃升,模型开始从“会回答”走向“能完成工作”。 Astra在数学、科学及复杂推理能力上进一步提升,FrontierMath Tier 4达到约98%,ARC-AGI-3达到99.9%;模型在部分复杂Agent及软件工程任务中能够以更少输出Token、更高成功率完成任务。大模型竞争指标有望从单纯关注Benchmark及单Token价格,逐渐转向Task Completion Rate、单任务成本、执行时间及人工干预次数,模型的经济价值开始更多体现为“完成一项真实工作需要多少成本”。➢ Computer Use与端到端专业工作能力迎来明显升级,AI正在从Copilot进一步演进为Agent。 Astra可以直接操作浏览器及计算机界面,完成网页操作、CRM更新、数据分析、软件安装测试、Coding及QA等任务;OSWorld 2.0得分由GPT-5.6 Sol的65.7%提升至72.6%,同时模拟单任务耗时由约75分钟下降至40分钟,结合新一代Codex Agent Harness后,Mind2Web任务完成速度提升至上一代体验的约1.9倍。Astra开始能够将检索、分析、代码执行、软件操作、结果验证以及Word/Excel/PPT等最终交付物制作整合到同一个Workflow中,意味着AI开始由“生成中间内容”向“直接交付结果”演进。➢ Agent有望率先重构软件开发及企业SaaS,软件竞争壁垒从UI和Seat数量进一步转向Data、Workflow与Permission。 在软件开发领域,AI能力正由代码补全向需求理解、开发、测试、Debug、浏览器验证及部署等完整Software Engineering流程扩展,有望持续提升软件工程人均产出;在企业软件领域,人机交互方式可能逐渐由“用户→SaaS UI”演化为“用户→Agent→多个软件/API”。拥有核心企业数据、深度Workflow、系统权限及Agent Orchestration能力的平台型软件厂商有望强化竞争优势,而缺乏核心数据及流程壁垒、主要依赖Per-seat收费的软件可能面临Seat压缩压力,商业模式或进一步向Consumption、Agent Seat及Outcome-based Pricing迁移。➢ Agent将AI计算需求从“人类调用”进一步升级为“自主循环调用”,Inference需求天花板有望继续打开。 传统Chatbot一次用户请求通常只对应有限模型调用,而复杂Agent为完成一个任务,需要持续进行推理、搜索、代码执行、Computer Use、结果验证及错误修正,单任务背后的模型调用次数可能由个位数提升至几十甚至数百次,任务持续时间也由秒级/分钟级向数十分钟甚至更长周期延伸。因此即使单位Token成本持续下降,只要Agent可执行任务数量、任务复杂度及经济价值持续提升,整体Inference Compute需求仍有望保持较快增长,持续利好GPU/ASIC、HBM、网络与光模块、数据中心及电力等基础设施环节。Agent有望成为下一阶段AI应用商业化和推理算力需求增长的重要驱动力。➢ 风险提示:大模型能力提升及Agent技术进展低于预期风险,Agent商业化及企业渗透低于预期风险,AI推理算力需求增长低于预期风险,AI应用商业模式及付费意愿低于预期风险,软件行业竞争格局变化风险,AI安全、权限及监管要求趋严风险等。请务必阅读正文之后的免责声明及其项下所有内容GPT-6 Astra发布:模型从“会回答”进一步走向“能解决问题”➢ OpenAI发布GPT-6 Astra,模型在数学、科学、软件工程等高难度任务上继续明显提升,FrontierMath Tier 4达到约98%,ARC-AGI-3达到99.9%。但相比单项Benchmark刷新,我们认为本轮更值得关注的是模型能力结构的变化:Astra不仅推理能力进一步增强,在长周期任务、工具调用、Computer Use以及端到端专业工作上的能力同步提升,大模型开始由单轮问答和内容生成进一步走向复杂问题解决。➢ 模型效率评价体系有望从单Token价格向单任务的成本转变。虽然Astra API单Token价格高于GPT-5.6 Sol,但在部分复杂Agent和软件工程任务中,由于输出Token减少、任务成功率提升以及执行效率改善,完成一个有效任务的综合成本反而可以下降。因此模型竞争的核心指标有望由“每百万Token价格”,转向“完成一项真实任务所需要的总Token、时间、成功率以及人工干预次数”。图:能力跃迁对比资料来源:OpenAI,国信证券经济研究所整理能力维度GPT-5.6 SolGPT-6 Astra意义FrontierMath Tier 483.0%97.6%前沿数学推理继续提升ARC-AGI-37.8%99.9%陌生环境探索与抽象推理跃迁Terminal-Bench 4.037.3%57.9%复杂软件工程任务能力提升OSWorld 2.065.7%72.6%Computer Use能力增强AutomationBench18.1%41.4%真实工作流自动化能力提升MRCR 512K–1M73.8%96.3%长上下文、长任务保持能力提升请务必阅读正文之后的免责声明及其项下所有内容Computer Use迎来代际升级,AI从Copilot进一步迈向Agent➢ Astra本轮最重要的能力突破之一来自Computer Use。模型已经可以直接操作浏览器和计算机界面,完成网页表单填写、CRM信息更新、日历管理、数据分析、软件安装测试、网站开发及QA等任务。在OSWorld 2.0测试中,Astra得分由GPT-5.6 Sol的65.7%提升至72.6%,同时模拟单任务耗时由约75分钟下降至40分钟;结合新一代Codex Agent Harness后,Mind2Web任务完成速度达到上一代体验的约1.9倍。➢ Computer Use的意义并不仅是“模型会操作鼠标和键盘”,而是AI开始能够将推理能力直接转化为现实工作流执行。过去Copilot更多提供建议、代码或内容,最终仍需要人完成软件操作;未来Agent则可以直接调用浏览器、Office、代码环境及专业软件,自主完成多步骤任务。GUI在一定程度上成为AI连接不同软件系统的“通用接口”,大幅降低Agent进
[国信证券]:AI系列专题研究:GPT-6 Astra:Computer Use突破,AI从Copilot迈向端到端Agent,点击即可下载。报告格式为PDF,大小0.84M,页数12页,欢迎下载。



