
OpenAI发布GPT-6 Astra,48小时压力测试揭示能力图谱:开发者用它24分钟重建可交互杭州全城、一天造出12人联机射击游戏、巴赫四声部合唱零错误创下基准最高分,不过但写作能力较前代明显退步,Elo评分下滑80分,定价却是上代的2.5倍。
OpenAI于9月3日正式发布GPT-6 Astra,早期测试者在48小时内将这次发布变成了一场公开压力测试,结果沿一条清晰的分界线呈现:Astra在空间理解、机械操作与自主代理任务上是迄今最强的模型,但在写作上,多名同一批测试者认为它不如自己的前代产品。
在最受关注的演示中,开发者用Astra在Unreal Engine里逐街重建了曼哈顿,另一名开发者在24分钟内用浏览器端3D库重建了杭州全城;一款支持12人联机的浏览器射击游戏在一天内完成;一段巴赫风格四声部合唱在独立基准测试中创下最高分,且无任何声部进行错误。与此同时,独立评测机构Artificial Analysis记录到Astra在涵盖44种职业的经济价值任务基准GDPval-AA v2上下滑约80个Elo分,写作能力的退步引发多名测试者明确批评。
Astra定价为每百万输入token 10美元、每百万输出token 50美元,是其前代产品GPT-5.6 Sol的2.5倍。OpenAI总裁Greg Brockman在发布简报中宣布AGI时代已经到来。该模型正在向ChatGPT Plus、Pro、Business及Enterprise用户以及API、微软Azure和AWS Bedrock渠道推出。
空间与视觉理解:最强的一面
早期测试中,Astra在空间感知与视觉重建方面的表现最为突出,多个独立案例相互印证。
投资人、前HyperWrite CEO Matt Shumer让Astra在Unreal Engine中工作了一周,最终生成了一份逐街还原的曼哈顿复制品。他随后进行了另一项实验:让Astra构建一个生存世界,并用模型的独立副本驱动其中每个角色,隔夜运行后发现这些角色已开始自发对话。
开发者Max Weinbach将苹果园区的照片输入模型,要求在Blender中重建,评价为"做得出奇地好"。Tom Krcha输入一张房屋外观图,得到了包含家电和玩具细节、以60帧每秒运行的完整室内可编辑几何体。Pietro Schirano将整个流程简化为在地图上标注一个坐标,模型随即生成周边区域的3D场景。
规模最大的案例来自一位以SuSu为名的开发者,其在24分钟内用Three.js重建了杭州及周边城镇,包含西湖、雷峰塔、茶园和湿地,并支持地标点击与昼夜切换,是可交互的"微缩杭州"而非静态图像。
0
评论 (0)