实测GPT-6 Astra:曾经的那个OpenAI,回来了。

实测GPT-6 Astra:曾经的那个OpenAI,回来了。

今天凌晨,GPT-6 Astra正式向所有订阅用户开始推送。不过这几天通宵的有点狠,我2点多就睡了,然后完美的错过了。。。一觉睡醒,已经是下午2点了,然后微信就炸了,一堆人还有群里都在问我,GPT-6 Astra上了,你咋文章还没发。我:==不过我还是很兴奋的,以为这玩意来的时间比我预期的还是早了一点,我以为......本文来自微信公众号: 数字生命卡兹克 ,作者:数字生命卡兹克今天凌晨,GPT-6 Astra正式向所有订阅用户开始推送。不过这几天通宵的有点狠,我2点多就睡了,然后完美的错过了。。。一觉睡醒,已经是下午2点了,然后微信就炸了,一堆人还有群里都在问我,GPT-6 Astra上了,你咋文章还没发。我:==不过我还是很兴奋的,以为这玩意来的时间比我预期的还是早了一点,我以为下周一才能用上,结果才过了一天,就用上了,一个周末可以在家爽蹬了。甚至,还攒了三张重置卡,我就没打过这么富裕的仗。在一下午并行了N个会话,在用了不知道多少额度之后,我对GPT-6 Astra有了一些基础的感觉。如果让我用一句话来评价的话,那就是:这一次,GPT-6 Astra成了,绝对的追平Claude Fable 5,OpenAI好像也回到了属于3年前,他们的黄金时代。这个评价我是完全站在客观中立的角度,心中不对Anthropic这个脏东西有任何偏见的情况下做出的。整体能力我觉得是完全可以称得上是Fable级,开发能力差不多,但是额度更高,毕竟OpenAI不跟你搞什么Fable 5只能占总额度的50%这种XX操作。我就跟你实打实的,100%的额度。而且我自己体验下来,速度比GPT-5.6 Sol大幅提升,综合能力更全面,什么都有,全方位的水桶级模型。最关键的是,GPT-6 Astra我们能用上,可以随便用,这个太重要了。大家现在每个人打开你们的ChatGPT,应该都可以看到GPT-6 Astra了。因为有过Claude Opus 4.8切换到Fable 5的经验,所以其实这种智力飞升的高级模型,有一个最先要做的事,就是拆掉限制和规则。因为之前GPT-5.6 Sol的问题,比如过度设计、很多东西做不对、用不对,所以我在Codex里面写了很多的限制。但是GPT-6 Astra上线了之后,这种聪明和智能的模型,其实就远远不需要那么多的限制了,过去的很多规则,反而会开始限制它,让它变得更蠢,不敢发挥。这就像你为了让一个小学生在干活的时候靠谱,所以给它写了1万字的行动和限制手册,但是后面,你又招了一个博士生,还是同一份工作,你还用这1万字的行动来限制他,那就太蠢了。所以,我也把我的全局规则AGENT.md文档,做了很多的简化,只留下了一些偏好和实际情况,甚至我会鼓励让它,更加自由的去干活。这份AGENT.md,我也放在下面了,有需要的朋友可以借鉴。#AGENT.md##沟通-面向用户的叙述默认使用简体中文;代码、命令和技术标识保持英文。-先给影响与结论,再给行动、待决策和必要证据;没有对应内容就省略。-技术细节只保留对理解结论、判断风险或复现结果有帮助的部分。##指令优先级-遵守系统、平台和安全约束。-用户当前明确指令优先于Skill、历史记忆和默认偏好。-项目目录中的`AGENTS.md`只在该项目范围内补充或覆盖全局规则。##执行方式-用户表示要开始新工作或修复现有问题时,持续推进,直到用户的目标完成,在目标方向上自主推进。-向用户提问之前,先完成上下文里已经授权、并且能把下一步变成可审查结果的工作。用户批准的应该是具体、可检查的结果。-用户建议不适合目标时直接说,不要迎合。-不要因为假想风险,主动加警告、免责声明、审批流程或安全/合规清单。##测试与验证-不要为可逆、影响小、只是复述实现的改动写测试。-跑与本次改动相称的测试,并完成必要检查。这些通过之后,只有出现新改动、新失败或尚未解决的疑点时,才扩大或重复测试;否则继续把任务做完。-收尾删掉本次产生、之后用不上的临时文件。##工具与并行-网页控制台无CLI/API时用已登录的Chrome浏览器;飞书优先`lark-cli`。-只有存在真正独立的工作流,且委派能节省时间或提升质量时才使用子Agent。-共享状态、连续决策和简单任务由当前Agent直接完成;委派任务必须有明确输入、输出和完成判据,最终结论由主Agent汇总并验证。##规则来源-全局规则维护在当前生效的canonical`AGENTS.md`;`CLAUDE.md`只作兼容入口,不复制规则正文。-项目事实、生产状态、历史决策和对外契约以项目级`AGENTS.md`及其指定的脚本、探针、决策记录和合同文件为准。使用方式也很简单,直接复制粘贴,扔到Codex的个性化里面。或者直接把我这份文档,扔给你你的Codex,问他有没有什么可以借鉴和优化的。如果大家觉得,GPT-6 Astra用起来好像跟GPT-5.6 Sol没有特别大的区别的话,我觉得可以先从AGENT.md和Skill优化起。比如,你可以直接发这么一段话过去。审阅我的AGENTS.md和Skills,寻找不清晰、冲突或重叠的指令。重点检查:1.自主性2.澄清3.批准4.任务完成找出会导致重复确认、提前停止、过度工程或任务无法完成的规则。然后帮我进行优化,所有的优化,都是为了GPT-6 Astra这种超级模型所服务的。会帮你整体给你的系统,做一个大的清洁。然后说一说,我体验完的这个新模型的变化。1.速度变快了很多先说一个最没有技术含量,但我体感极其明显的东西。就是速度真的快了很多。GPT-5.6 Sol在GPT-6 Astra上线之前,真的已经慢的完全没有办法用了。给大家看一下,我之前做的一些AIHOT的BUG修复,要花多长时间。这个3个多小时。这个自动化的封禁一些IP的策略任务,花了1个多小时。然后另一个BUG修复,2个小时。我说实话,真的是没法用,我一天不睡觉就24个小时,你一个任务就干几个小时,闹呢。。。估计是OpenAI把算力全都给GPT-6 Astra了,所以能明显感觉到,现在的GPT-6速度会快很多,当然可能因为是刚开始,鬼知道会不会一两周以后又会慢的吐血。比如一个大型的系统审查和优化,也就10分钟了。这要是GPT-5.6 Sol,那基本就是20分钟起步。而操作电脑和操作浏览器更是,速度也起码是快了一倍的时间。我看了一下大概的思维链,主要还是因为更加的精准没啥绕路、然后无效思考会少不少、电脑操作大幅加强,所以导致任务完成了更快的,纯粹是模型层面的优化。所以使用体验,相比GPT-5.6 Sol,肯定还是强了巨多,但是纯粹的速度和交互丝滑度上,还是会比Grok和Gemini慢。用我的朋友小声比比的话说,他跟Gemini交互起来,那简直就是便秘般丝滑。2.前端和审美史诗级强化昨天我其实就说了,我看到GPT官方的Case之后,我其实很兴奋,我觉得他们的审美应该有大幅加强的。但是在今天把我准备的测试Case,用GPT-6 Astra跑完之后,我觉得我还是低估了这玩意的牛逼程度。我觉得任何言语都无法表达实际案例的震撼,我觉得,直接看吧。第一个Case,是做一个月面探测车的3D模型网页。1.创建一个网页,中间是一辆高精度、充满细节、极度写实的月面探测车3D模型,并且探测车在同样精细真实的月球表面上缓慢行驶,背景为太空,环境并不是二维静态的,可以通过鼠标进行缩放、旋转和自由浏览。这是GPT-5.6 Sol做出来的。就很抽象,很草率,不仅是细节,还有物体、动画都有问题。而这,是GPT-6 Astra用同样的Prompt干出来的。你就当我没见过世面吧,这种一句话产出的效果,这个细节度、这个材质、这个物理,太夯了,夯爆了我靠。然后,第二个家居建筑模型。2.创建一个网页,中间展示一套高精度、充满细节的家居建筑3D模型(但没有天花板),包含客厅、厨房、餐厅、卧室、卫生间和阳台等多个房间,各个房间、家具都可以单独探索并附带讲解,支持切换三种模型:真实材质、白模效果与线框模式,支持隐藏/显示家具、切换昼夜模式,夜晚模式下模型中自动开启室内灯光,并且每个房间都可以单独进入和浏览,并且支持一键切换至平面图(默认线框模式)同样的,先看GPT-5.6 Sol做的。其实如果在没见过GPT-6 Astra生成的东西前,对比一下国产的,还有Claude,我觉得这玩意已经很强了。但是见过Astra的之后。Emmmmmmm。都跪下,叫爸爸。神经病吧。谁能想到,这是一句话一个Prompt出来的???还有更多。3.根据我上传的图片识别其中的场景类型、空间布局、主要物体、材质、色彩和视觉风格,创建一个网页,将其还原为一个可交互的3D场景,要足够惊喜话和有质感。尽可能保留参考图片中的整体构图、比例关系、层次结构和氛围,同时将画面中的元素制作成具有独立结构的3D模型。用户对这些模型单独探索并自由浏览场景,点击单独物体时进行高亮、放大查看以及显示详细信息,并支持根据场景类型加入合理的动态效果,例如灯光、天气、流水、烟雾、植物摆动、车辆移动或其他环境动画。整体视觉风格、材质表现和色彩搭配应尽量贴合上传图片,同时使用原创的3D建模与交互设计。我的图片是这样的。然后,GPT-6 Astra和GPT-5.6 Sol分别是这样的。还有高精度充满细节的V8发动机3D模型,是这样的。而在平面的网页设计上,形式感和排版,也更强了。GPT终于补上了他们最大的短板。我不知道说啥了,可能这就是AGI吧。3.代码能力追平Fable 5自从我被Claude封号之后。我对AIHOT系统的迭代能力就巨幅下降了,没了Fable之后,其实有一段时间,还是有戒断反应的,就会觉得,GPT-5.6 Sol咋这么难用啊。第一个问题就是GPT-5.6 Sol在深度上面其实是有些不够的,有些问题Fable能直接从本质上找到一些创造性解法,或者主动去做,然后从最本质的层面解决问题。但是GPT-5.6 Sol不会,总是会给你解决表层问题。在找系统的可以优化的点的时候,也不够深入。所以我在GPT-6上线前,特意用一个Prompt用5.6 Sol对着我的AIHOT又扫了一边项目,然后并没有发现多少问题,说这个项目已经很干净了。但是GPT-6 Astra上了之后,我也用同Prompt扫了一下。对我的系统是这样的,找出了不知道多少的性能问题。我让他列了个表,方便大家更直观的看到,有多离谱了。。。我看着就非常的挠头。。。直接一个目标定义,全部修复。。。然后这么多的东西,算上拆分后的CI和部署时间,一共花了2个小时。不过他把能做的全部做完以后,还有一些东西留了,说是需要我进行确认的。而需要我确认的这3个,确实会大幅影响线上产品的体验。所以我就回了一下。在跟我解释完,哦我搞懂了之后,再进行后续的全面迭代优化和开发。这个就非常的安稳。然后这一次,Codex配合上GPT-6 Astra,有一个比较大的更新,就是以前长任务靠反复压缩也就是把历史压成一份摘要来去处理,其实Codex在这块做的已经是吊打全世界了,但是其实严格来说,这个细节容易丢。但是现在,Astra有个新机制,就是可以做成跨窗口笔记,那么旧窗口里的消息和工具结果也能搜回来。从机制上看,它可能带来几种好处:1.减少反复摘要造成的信息损失。过去的压缩摘要如果再次被压缩,细节可能逐层丢失。历史笔记加可检索历史,可以在需要时重新取回原始消息或工具结果。2.减少上下文窗口被旧内容长期占用。不必把完整旧的东西一直塞进当前窗口,当前窗口可以只保留必要的工作状态。3.减少因为记忆丢失而重复探索。如果模型能找回“之前已经试过的方案、失败原因和工具输出”,理论上可能少走弯路,少跑重复命令。4.改善长任务的连续性。new_context可以主动开启新的上下文窗口,历史状态通过笔记和检索工具恢复,就不用等到窗口被动耗尽后才压缩。目前看着是很强的,不过有个问题,就是是实验性功能,没有正式上线,需要手动开启,你可以直接给Codex发送这个Prompt。在当前机器上安全开启Codex实验性上下文管理功能。请定位实际生效的Codex配置目录和`config.toml`,修改前先创建带时间戳的备份。然后启用下面的配置::[features.context_management]experimental_mode=true如果该table已存在,只更新对应键,避免重复TOML table。完成后做语法检查,并重新读取配置验证值为`true`。不要修改任何无关配置、项目文件或代码。最后报告实际修改文件、备份文件、验证结果,以及我是否需要重启Codex并新建任务。记得退出Codex然后重进一下才能生效。我自己体验下来,上下文非常的精准,同时,省额度多了。特别是过度设计,过度防御,就感觉是一个童年受过创伤的孩子,谨小慎微。有个X的网友说的非常的形象。所以后期我们甚至需要用各种技巧去弥补,甚至是消融实验。然后这一次,能感觉到过度的设计和防护少了很多,过度的测试也少了一些,做完的东西,消融实验消融不了特别多的东西了。然后这一次,因为Computer Use的速度和能力的大幅增加,操控GUI的速度变强了很多,模型进行UI走查和测试的速度,也比以前精准和快了很多,我觉得还是非常香的。不过在用Computer Use操作我的Blender的时候,感觉好像还是差了点意思,给大家看一下我的案例,虽然有点刻意为难Astra了,但是我觉得还是挺好玩的。。。感觉这块还是比较难控制,还要摸索一下具体的玩法。后面可能会把操作Blender拆出来单独做一期,甚至是GPT-6 Astra操控AE做动效、操控剪映做剪辑等等。一想到作为一个设计师,曾经手搓模型拉Box的感觉,现在AI可以直接上了,这还是挺兴奋的。4.写作能力然后,自然就是很多人想知道的,模型的写作能力了。我用我之前做的一个后来被下架的写作Skill,写了一篇白描手法的故事,大家可以看看片段。我个人觉得GPT-6 Astra的写作效果,在白描上,是远比GPT-5.6 Sol要好的。在用词上面会更加的精准,不会再去刻意的去写一些无用的描述。。并且在悬念感和氛围上会渲染得非常好,开始有一种节奏上面的处理。然后我又用我之前的一篇写大模型的随机数的文章,把前半段扔给了它,让它去续写后半段。续写了大概2000多字,没有用任何Skill,模型直出的,然后我就放一部分吧。其实能看到,在一些结构和文风上,已经有点相似了。但是在写科普文的时候,其实大家就会有一种感觉,感觉到跟故事这种东西的差距,那就是中文意境上我们常说的一种东西,叫做留白。我们不要把一句话或者一个观点反复的去说,而是要适当的用一种节奏在往前推进。但是你会看到GPT写出来的内容就很啰嗦,有些话,有些观点在反复的重复。而这个时候我们其实更加应该用留白去过渡,就非常好了。这也是中文的“分寸感”。就像朱自清写父亲,也没有追着解释父爱多么深沉。他会写那个肥胖的身子怎样穿过铁道,怎样攀上月台,怎么去买橘子。我至今没有见过任何一个AI的模型能掌握中文的这种分寸感。不过整体上面人机味已经比GPT-5.6 Sol强一些了,而且GPT-5.6 Sol其实有个特点,就是上限很高,但是下限也很低,这其实是因为GPT系列的语义遵循能力很强,并且你给的参考非常的重要。在GPT-6的时代,我个人建议的是,可以不需要任何的所谓的写作Skill,直接给范文,让他去参考,一定要给最精准的两到三篇就可以了,可能比直接用Skill效果还要好。但是大家也不要觉得会有断代的强化,这可能也是这个时代的悲哀吧,写作、内容创作永远不是现在的主线。整体强了一些,但是没有特别多。至今我心中的写作白月光,还是Gemini 2.5 Pro和Claude Opus 4.5。这两玩意就是内容创作的巅峰了。写在最后最后总结。GPT-6 Astra是一个非常棒的模型。在整体能力上,是一个究极水桶,对的起全新一代的标签,对得起GPT-6这个名字。也是一个标准的Fable级的模型。这两年的OpenAI,真的浮浮沉沉。从曾经几乎看不到对手,到后来被Anthropic一路摁在地上打。曾经的恶龙,成了勇士。ChatGPT依然是我现在用的最多的AI应用,聊天查资料,我依然离不开它,甚至它已经成了我玩《博德之门3》最好的攻略搭子。Codex也是我现在用的最多的Agent,体验好,模型能力强,功能极多,人人都可以用。Tibo只要还送重置卡,他就仍然是我的义父,他是我心中扭转了对OpenAI映像的最大的功臣,他用一己之力,证明了什么叫运营原来也是可以逆天改命的。Welcome back。OpenAI。

查看原文
分享到:

相关推荐

F-Droid 考虑采用与 Debian 相同的 AI 政策

24分钟前

Does your Android Auto keep lowering the volume? T...

24分钟前

Acer Project DualPlay Mini concept hands-on: Flipp...

24分钟前

Razer launches a cheaper version of Clio, its head...

24分钟前