随着地方时间9月3日的到来,OpenAI正式推出了其最新模型——GPT-6 Astra,并将其定义为“下一代智能”。“Astra”在拉丁语中意指“星星”或“群星”。在发布之前,ChatGPT的官方预告曾提到:“星星几乎排列好了。”OpenAI指出,Astra是当前全球智能水平最高、与人类需求对齐效果最佳的模型,它在电脑操作、网络浏览、软件开发、网络安全、科学研究及专业工作等多个领域实现了显著的突破。OpenAI的首席执行官山姆·奥特曼对外表示,希望Astra能够开启“新一代的创业和科学探索”,并称其在多项领域都是“最强大的模型”。OpenAI总裁格雷格·布罗克曼更进一步评论,未来人们可能会将这一时刻和这一模型视作AGI(通用人工智能)问世的标志:“欢迎进入AGI时代。”星星已经排齐,GPT-6 Astra正式亮相。
在操作能力方面,Astra能够自主填写网络表单、更新客户关系管理系统(CRM)中的记录、整理日程安排,还可以执行网络搜索、编写邮件和文档摘要。它还具备分析科学数据、生成可视化图表、搭建网站以及进行前端质量测试的能力。在软件开发过程中,Astra能够独立安装和测试软件,解决界面上出现的问题。与传统聊天机器人不同,用户可以直接对Astra设定具体目标,比如“帮我准备一份财务分析并制作演示文稿”或“开发一个游戏原型并测试其运行情况”。模型可以自主分解任务,调用相应工具,进行持续的实施,最终交付成果。
根据OSWorld 2.0的测试,Astra的得分为72.6%,而GPT-5.6 Sol则为65.7%;在延迟模拟环境下,Astra完成一项任务所需的平均时间约为40分钟,相较之下,GPT-5.6 Sol需要约75分钟,OpenAI由此表示Astra的任务完成时间减少了47%。在Mind2Web测试中,结合了更新版本的Codex harness后,Astra的任务完成速度是当前GPT-5.6 Sol的1.9倍。在OSWorld 2.0测试中,Astra获得72.6的优异得分。
奥特曼在接受外媒采访时提到,Astra在用户体验方面与之前任何模型都截然不同,这是首个让他心安理得地鼓励用户大胆尝试的模型。用户可以委托Astra构建复杂的互动软件、开发电脑游戏、进行DIY电子工程项目、运行科学模拟,甚至制作财务模型并自动生成PPT。OpenAI表示,Astra结合了复杂的推理能力和多步骤工作流程,可以直接生成并处理文档、电子表格及演示文稿,并安排页面布局,提取与任务相关的信息。
在Professional评测中,Astra在AutomationBench取得41.4%的得分,而GPT-5.6 Sol为18.1%;在BenchCAD,Astra则为95.9%,而GPT-5.6 Sol为83.3%;在BrowseComp测试中,Astra得分为91.5%,GPT-5.6 Sol则为90.4%。这些数据反映了两者在自动化任务、计算机辅助设计和网络信息检索等多个应用场景中的显著差异,而AutomationBench中的差距更为明显,Astra的优势显著。
OpenAI对外展示了企业案例,表明Astra正被广泛应用于更贴近真实工作的场景。法律科技公司Legora利用Astra进行财务报表审核,在相关基准中,Astra的表现提升了约40%,并在一次运行中用数分钟时间审核41份文件,发现了隐含的四处错误。游戏开发公司Playco则使用Astra进行游戏原型开发,测试结果显示其人为干预工作减少了50%,且从一个灰盒基础原型成功制作出三个不同主题的游戏原型。
科学研究也是此次GPT-6升级的重要关注点。OpenAI指出,Astra在数学及科学领域创下了新高分。在FrontierMath Tier 4(v2)评测中,Astra得分97.6%;在ARC-AGI-3中获得99.9%成绩;而在GPQA Diamond评测中则得分96.0%。在科学和健康相关的评测中,Astra在GeneBench Pro中得分37.8%,MedChemBench为49.3%,LifeSciBench为60.3%,HealthBench Professional则为63.4%。OpenAI特别强调,Astra能够将科学推理与电脑操作相结合,进入专业软件检查数据,支持研究人员分析证据,决定下一步的研究方向。
最后,OpenAI重申,编程能力依然是GPT-6 Astra的重要卖点。Astra被视为公司迄今为止最具潜力的人工智能驱动的编程助手。
全国咨询热线
qy球友会·(中国)官方网站入口
联系电话:13594780501
联系人:李总
邮箱:tainted@qq.com
公司地址:漳州市把园神殿178号
微信扫一扫
手机官网