

昨天还被Claude Fable 5.1压着打,今天OpenAI直接甩出大招——GPT-6 Astra来了!
一口气拿下全球多个领域的"最强模型"称号,数学考了97.6%、网络安全直接满分、计算机使用刷新纪录……甚至在电话会议里,OpenAI总裁放话:这或许就是"AGI时代"的起点!
等等,真有这么猛?跟我一起扒一扒。
就在9月2日,Anthropic刚推出号称"全球最强"的Claude Fable 5.1和Mythos 5.1。结果不到两天,OpenAI就用Astra完成了一次教科书级的"狙击"。
FrontierMath Tier 4测试堪称"数学界的珠穆朗玛峰",而GPT-6 Astra直接拿下97.6%的高分!什么概念?它不光会做题,还帮人类解决了长期悬而未决的开放性问题。
这个测试考的是面对陌生任务的学习能力。GPT-6 Astra考了99.9%,而人类测试者的平均分只有48%。
这差距,让人脸往哪儿搁?
在ExploitBench测试中,GPT-6 Astra拿到了100%!它也成为OpenAI首个达到"关键级"网络安全能力阈值的模型。企业级市场的大门,这回是真被撞开了。
OpenAI说了,Astra是"世界上最好的计算机使用模型"。这可不是吹的,因为它真的能帮你干活。
网上填个申请表、帮你更新客户记录、管理你的日程安排……这些繁琐事儿,Astra眼睛都不眨一下就能搞定。
别以为它只会"轻活"。搜索儿科医生?2分54秒搞定。找公寓?不到10分钟。预约车管所?5分10秒。
这些事,你手动折腾没俩小时下不来吧?
从用KiCad做PCB电路板布局,到用Unity搭建城市场景,再到把设计稿变成能走的3D房间——Astra全都上手了。15秒的视频回放里,它自己完成了一整个PCB布局工作。工程师们,你们的板子以后不用自己画了?
2023年微软Excel世界锦标赛的挑战,Astra做金融建模的速度大约是冠军的4倍!分析师以后可以把省下的时间花在解读结果上,而不是吭哧吭哧建模型。
很多人第一反应:这么强的模型,肯定贵得离谱吧?
在一些专业任务上,Astra的API成本比上一代低了43%,和对手比更是低了86%!用更少的钱,干更好的活,还有比这更香的吗?
简单来说,就是Astra用更少的话说清更多的事。有的任务输出token直接减少了65%,成本和技术双重碾压。
标准版定价:每百万输入token 10美元,输出50美元。确实比上一代贵了不少——但和刚发布还热乎的Claude Fable 5.1定价一模一样。
同样的钱,更好的性能,你选谁?
如果你是写代码的,这篇得重点看!
在复杂终端任务上,GPT-6 Astra拿到57.9%,破纪录了!上一代Sol只有37.3%,Claude Fable 5.1是55.8%。
在真实代码库上测数据库迁移任务,Astra直接拿下63.9%的新纪录。而Claude Fable 5.1是57.8%,自家Sol只有42.7%。
以前的模型经常干着干着就"跑偏"——新的需求一来,之前的任务就全忘了。Astra不会!它能整合新需求、调整方向,但不偏离主任务。
这种感觉就像带了一个记性超好的同事干活,太省心了!
Astra在科研领域的表现,也让人眼前一亮。
研究生水准的科学推理测试GPQA Diamond,Astra拿下96.0%——比上一代最高分还高,成本还降了37%。
它能引导科学软件检查测序质量、可视化遗传变异,帮研究人员判断下一步该研究什么。
把19世纪的古老乐谱扫描件,转录成能编辑的数字乐谱——转录出错率从0.813直接降到0.159,降了81%!
音乐家们,你们的福音来了。
看完这么多测试数据,你可能会问:跟我有什么关系?
关系可大了。GPT-6 Astra带来的不只是分数上的提升,它正在把AI从只会"聊天"的工具,推向能真正帮你干活的"数字同事"。
OpenAI总裁那句"AGI时代的起点"或许有夸张成分,但AI的进化速度,真的已经超出了大多数人的想象。
今天你还觉得AI是个玩具,明天它可能已经在帮你改代码、做电路板、写论文了。
那么问题来了——如果AI真的能胜任大部分工作,你最想把哪件烦心事交给它?
如果觉得这篇内容有用,别忘了点个【在看】+【分享】,让更多朋友看看OpenAI这次到底放出了什么大招!