OpenAI 曝光 Astra 新模型,DeepSeek V4 Flash 直逼 Opus 4.8

导语

OpenAI 在华盛顿演示全新模型系列 Astra,主打长周期任务能力;DeepSeek 同步更新 V4 Flash,多项基准逼近 Opus 4.8;

一、OpenAI 曝光 Astra 新模型:主打长周期任务能力

据 The Information 8 月1日报道,OpenAI CEO Sam Altman 本周在华盛顿向政策制定者演示了全新的 AI 模型系列——**Astra**。

Astra 源自拉丁语,意为"群星"或"星辰",与 OpenAI 现有的 Sol(太阳)、Terra(地球)、Luna(月亮)形成一套宇宙主题命名体系。

核心能力,Astra 的最大亮点在于:

知情人士透露,Astra 已经进入测试阶段,有望成为首批按照特朗普政府拟议新框架、在公开发布前提交美国联邦政府审查的 AI 模型。但目前尚未确定是命名为 GPT-6 还是 GPT-5.7。

二、DeepSeek V4 Flash 上线公测:性能逼近 Opus 4.8

根据官方披露的数据,这款 2840 亿参数模型在多项基准测试中表现惊艳:

测试场景

得分

Terminal Bench 2.1 终端操作

82.7

NL2Repo 代码仓库任务

54.2

DeepSWE 代码任务

54.4

Cybergym 网络安全

76.7

Agent Last Exam 综合智能体

25.2

DSBench-FullStack 全栈开发

68.7

DSBench-Hard 难度升级版

59.6

更值得关注的是价格。新版本 API 定价仅为 Claude 同类产品的 1/90。在 Artificial Analysis 7 月 31 日更新的综合指数中,GPT-5.6 Luna(max)得分 51,DeepSeek-V4-Flash-0731(max)得分 50,仅差 1 分

跑完整套评测的账单对比更直观:Luna 约 190.87 美元,DeepSeek 约 72.02 美元,便宜约 62%

结尾

对于开发者而言,这是一个机会窗口:开源模型在性能上正在快速追赶闭源旗舰,同时成本远低于商业 API。在选型时,不妨将目光从单一的"模型能力榜"转向"任务适配度+成本结构+安全可控性"的综合评估。

你觉得 DeepSeek 的"性价比路线"会让 OpenAI 真正紧张吗?欢迎在评论区聊聊你的观察。

展开阅读全文

更新时间:2026-08-04

标签:科技   模型   能力   华盛顿   智能   得分   周期   基准   演示   拟议   体协

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top