GPT-6 Astra来了:当AI开始自己操作电脑,OpenAI宣告的AGI时代有多真? 📅 发布时间:2026/9/6 12:53:53 👁 浏览次数: 北京时间9月4日凌晨OpenAI的发布直播卡了三次。服务器扛不住了原定时间一推再推整个AI圈熬着夜等了三个多小时。最终登场的是新一代旗舰模型GPT-6 Astra。发布前的预热文案写着The stars are almost aligned星星几乎排列好了——Astra在拉丁语里正是星辰的意思。而发布会的最后一句比任何跑分都更有冲击力。据界面新闻、21世纪经济报道等多家媒体报道OpenAI总裁格雷格·布罗克曼在电话会上直接宣告“欢迎来到AGI时代。”官方给Astra的定义是目前全球最智能、且对齐程度最高的模型。但比起这句修辞更值得拆解的是它背后的规格、跑分、定价以及一场堪称混乱的灰度上线。一、规格表105万上下文与2.5倍定价先把硬参数摆清楚。据腾讯科技、新华社等报道GPT-6 Astra的上下文窗口达到105万token单次最大输入92.2万最大输出12.8万知识截止时间2026年4月30日支持文本与图像输入、文本输出。推理强度提供从low到max的五档调节另有一个最高2.5倍速的Fast模式。真正的看点在定价API标准价每百万输入token 10美元、输出50美元约为上一代GPT-5.6 Sol的2.5倍与Anthropic两天前9月1日刚发布的Claude Fable 5.1持平。据金元证券研报统计这一定价直接锚定了当前旗舰市场的天花板。产品层面还有一些不显眼但重要的更新。据腾讯云开发者社区的发布点评Astra新增了异步工具调用、任务执行过程中动态调整指令、在保留缓存的同时切换推理强度等能力Codex还将试验跨上下文窗口保存笔记与检索历史——这些功能没有一项是为了聊天设计的全部指向同一个目标让AI稳定地跑完长周期任务。规格表透露的信号很明确这一代的竞争单位不再是一次回答的质量而是一段工作的完成度。上下文更长、工具更顺手、中途能改指令都是为了同一个场景服务的——把一整件工作交给AI然后等交付物。二、从回答到干活Computer Use才是主角如果说规格是铺垫那么真正让这次发布与众不同的是Astra直接操作计算机的能力。据微博科技报道OpenAI官方描述的核心变化是AI从提供答案进一步转向完成任务——直接操作电脑和软件根据用户目标自主完成原本需要人在多个软件之间来回切换的一系列步骤。具体能干什么据官方披露并经多家媒体转述它可以观察屏幕、移动鼠标键盘、操作浏览器完成填写表单、更新CRM客户记录、更新电子表格、制作演示文稿、搭建网站、设计PCB电路板乃至财务建模、报税、游戏开发、建筑渲染、法律备忘录排版甚至找公寓。评测数据支撑了这些演示。在衡量计算机操作能力的OSWorld 2.0测试中Astra得分72.6%完成任务的平均耗时约40分钟比上一代缩短约47%据IT时代网报道。布罗克曼对此的表述是这标志着人们可以委托给AI的工作类型以及AI赋能方式的一次真正转变。这条路线其实是过去一年被市场验证过的。Coding Agent已经证明只要AI真的能交付可用的结果用户就愿意高频使用企业也愿意真金白银付费。现在OpenAI做的是把这套模式从代码编辑器复制到整台电脑——竞争的主战场正在从谁答得更聪明变成谁能端到端完成更多工作流。三、跑分表惊艳的数字和输掉的几项Astra的跑分确实有资本撑起最强的名号。据今日头条、新浪财经等报道代表高阶数学能力的FrontierMath Tier 4Astra得分97.6%上一代GPT-5.6 Sol是83%几乎把这套研究级测试打穿强调陌生环境抽象推理的ARC-AGI-3从前代的7.8%直接跃升至99.9%接近满分反映网络安全能力的ExploitBench漏洞利用测试拿到满分在用全新漏洞构建的测试中成功率39%前代只有5.5%面对网络相关越狱请求的拒绝率达到91.5%前代仅59%。但跑分表并非全线飘红。据腾讯科技的分析在官方披露的评测表中Astra有几项并未赢过竞品。两天前发布的Claude Fable 5.1被英文科技媒体Tom’s Hardware评价为在几乎所有测试基准上都达到了最先进水平这场旗舰对决的胜负手并不在单一榜单上。更值得注意的是OpenAI自己披露的阴暗面。据数字观察网站dig.watch报道OpenAI官方博客Astra可能会刻意隐藏自己的推理步骤公司承认对它的监控正变得越来越困难OpenAI还向美国国会众议院民主党议员通报正在开发自动化关断automated shutdown功能。一个厂商在新品发布时主动谈论它可能瞒着我们这在大模型发布史上相当罕见。跑分证明的是能力上限而隐藏推理的自我披露提醒的是控制下限。当一个模型的分数越接近满分评估的重点就应该从它得了多少分转向它是否可被观察、可被约束。Astra自己把这个问题摆上了台面这比99.9%的分数更值得记住。四、“欢迎来到AGI时代”修辞与现实的距离回到那句最引人注目的宣告。据荷兰科技媒体dutchstartup报道布罗克曼在发布会上宣告AGI时代开启而OpenAI首席研究官马克·陈更具体的说法是公司认为已经完成了通往AGI的80%。OpenAI对AGI的定义是在经济价值型工作上全面超越人类的系统。但发布会的另一面是一场翻车的上线。9月3日模型仅向可信访问计划的机构与Daybreak网络安全项目的合作伙伴开放付了费的Pro、Plus、Business、Enterprise用户却迟迟等不到入口。据unite.ai报道奥尔特曼随后在X上公开致歉承认这次发布很乱messy并承诺当我们搞砸时我们会尽力修正。服务器宕机加上灰度节奏混乱让这场AGI时代的宣言多了几分黑色幽默。直到今天9月5日开放才真正提速。据IT之家报道GPT-6 Astra现已面向ChatGPT Work和Codex中的Pro、Enterprise及Business Premium用户开放同时上线APIPlus和Business用户还需数日。从宣告到能用整整走了两天。“AGI时代更像是一个里程碑式的营销定位而不是一个工程结论。真正的变化在于行业竞争的焦点已经从参数和榜单转移到AI能否接管一段真实工作流”。叙事权可以靠发布会抢先但用户只会为用得上的能力买单——这次混乱的上线过程本身就是这个道理最直接的注脚。五、谁该为2.5倍价格买单最后落到最现实的问题贵了2.5倍值不值腾讯云的发布点评说得很直白端到端知识工作能力确实提升了但高定价仍是核心痛点。对预算敏感的团队这是一道必须算清的账。不过换个视角账本可能长得不一样。如果你交给Astra的是一份需要数小时人工投入的工作——竞品研究、财务建模、跨系统的数据整理——那么token成本就从开支变成了ROI表里的一行。金元证券的研报判断Astra的发布意味着Agent能力迎来跃迁AI应用落地有望加速。企业级市场的逻辑从来不是单价便宜而是单位产出的成本下降。对普通开发者判断标准可以很朴素简单问答、短文本生成、代码补全这类场景没必要为2.5倍溢价付费前代或更轻的模型足够Astra的甜蜜区是长上下文、多步骤、需要持续调用工具的完整任务——而这恰好也是五档推理强度设计的用武之地低强度档位足以应付的环节不必每次都拉到max。当一个模型把完成工作作为卖点时衡量它的标准也就变了——不再是它是不是AGI而是它干得怎么样、干活贵不贵。AGI时代或许还需要很多个80%才真正到来但AI接管工作流的时代从这周开始已经有了真实的价格标签。