数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

DeepSeek V3.1大模型升级,适配国产新芯片,性能显著提升

2025-08-24来源:ITBEAR编辑:瑞雪

中国人工智能领域的明星企业DeepSeek近期宣布了其旗舰大语言模型的重大更新,新版本针对即将面世的新一代国产芯片进行了专门优化。

据DeepSeek介绍,此次升级采用了名为UE8M0的新型数据类型来训练V3.1模型,这是对现有FP8格式的一种扩展,已被英伟达等业界巨头所支持。DeepSeek在微信平台上澄清,这一变化是为了更好地适配即将推出的国产芯片,指出“UE8M0 FP8专为新一代国产芯片设计”。

使用较低精度的数据类型带来了诸多优势,包括减少内存占用和提升推理及训练速度。值得注意的是,DeepSeek之前已经在使用FP8格式中的E4M3类型。因此,转向UE8M0更多是为了确保与新一代芯片的兼容性,而非单纯追求效率提升。

虽然DeepSeek未透露新模型所适配芯片的具体制造商,但有报道称这家AI初创公司与华为有着紧密合作,利用华为的昇腾系列神经处理单元(NPU)进行模型训练和推理。华为的昇腾910C为其CloudMatrix机架系统提供动力,但目前不支持FP8格式,这或许意味着华为正在研发性能更强大的加速器。

有消息指出,DeepSeek曾尝试在华为昇腾加速器上训练其下一代R2模型,但因遇到困难而改用英伟达的H20加速器。不过,DeepSeek目前仍在评估华为加速器的推理性能。

关于R2模型,目前尚不清楚它是否就是此次发布的V3.1版本,或是另一个即将推出的模型。

值得注意的是,DeepSeek V3.1并非从零开始的全新模型,而是基于早期V3版本的检查点进一步训练而成。尽管如此,这一新版本在功能上有显著改进。V3.1版本不再区分“思考型”和“非思考型”模型,而是将两种范式整合到单一模型中,并通过聊天模板实现模式切换。因此,DeepSeek的聊天机器人界面也不再提及R1版本。

统一模型以支持推理和非推理输出的概念并非DeepSeek首创。阿里巴巴今年早些时候也曾尝试过类似做法,但因发现该功能降低了模型质量而放弃。然而,在基准测试中,DeepSeek的V3.1版本似乎成功避免了这一问题。与V3版本相比,V3.1的非思考模式在各项指标上都有显著提升。

在启用思考功能后,V3.1版本的性能提升虽然相对温和,但DeepSeek指出,该模型现在需要更少的思考Token就能给出答案,这将有助于降低模型服务的成本。

在上下文处理能力方面,DeepSeek将V3.1版本的上下文窗口(即短期记忆)从65,536个Token扩展到131,072个,尽管这一数字仍然落后于阿里巴巴的Qwen3等其他中国模型,后者能处理高达百万级的Token上下文。

DeepSeek还声称在工具和函数调用能力方面取得了重大进展,这对于需要实时检索外部数据和调用工具的AI工作负载至关重要。例如,在针对自主浏览器使用任务的Browsecomp基准测试中,DeepSeek V3.1版本获得了30分的高分,而R1版本的5月版本仅得8.9分。

除了通过聊天机器人服务和API端点提供服务外,DeepSeek还在Hugging Face和ModeScope平台上提供了基础模型和指令调优模型的权重下载,方便开发者进一步定制和优化。

关于DeepSeek V3.1版本的更多信息,以下是几个常见问题及解答:

Q:DeepSeek V3.1有哪些新特点?

A:V3.1版本最大的特点是使用UE8M0数据类型进行优化,专为即将发布的国产芯片设计。同时,它整合了“思考型”和“非思考型”模型功能,在单一模型中通过聊天模板实现模式切换,并将上下文窗口的Token数量大幅提升。

Q:为什么DeepSeek要切换到UE8M0数据类型?

A:DeepSeek切换到UE8M0主要是为了与即将推出的新一代国产芯片保持兼容。尽管公司之前已在使用FP8的E4M3类型,但UE8M0是专为新一代国产芯片设计的,预示着可能有更强大的国产加速器即将面世。

Q:DeepSeek V3.1版本的性能如何?

A:在基准测试中,V3.1版本的非思考模式相比V3版本在各项指标上都有显著提升。在工具调用方面,V3.1版本在Browsecomp浏览器任务测试中得分高达30分,远超R1版本的8.9分。同时,该模型现在需要更少的思考Token就能给出答案,有助于降低服务成本。

iPhone17系列销售势头猛 本周国内激活量或冲破1000万台大关
【CNMO科技消息】11月14日,据数码博主爆料称,iPhone17系列国内激活量将于本周突破1000万台。截至11月2日,该系列在国内的激活数量已突破825万台,其中iPhone 17 Pro Max约3…

2025-11-14

95后「AI天才少女」罗福莉加入小米,AI圈人才争夺再掀热潮
DeepSeek员工、有天才名号、小米雷军出千万年薪挖角,这几个因素叠合起来,让不怎么关注 AI 的网友都知道了这位 95 后技术大牛。暂且不说这“千万年薪”是不是真消息,能让雷军出动请人, 相信大家都能从…

2025-11-13

原DeepSeek核心成员罗福莉加盟小米MiMo团队
近日,一则科技圈的重磅消息引发广泛关注:曾参与DeepSeek-V2大模型研发的“天才少女”罗福莉,正式宣布加入小米Xiaomi MiMo团队,并表示将“全力奔赴心中的AGI(通用人工智能)”。这一消息不仅证实了此前关于她跳槽小米的传闻,更透露出小米在AGI领域的战略布局。

2025-11-13

双11手机市场:苹果销量领跑,小米成国产手机销量佼佼者
【太平洋科技】11 月 12 日消息,本年度的双 11 正式收官,各大电商平台的品类销售排名也随之揭晓。据京东官方数据,在全部品牌销量累计榜中,苹果、小米、vivo 占据前三席位。在全部品牌销售额累计榜…

2025-11-12

中国折叠屏手机市场回暖,2025年全球出货量或达5470万台引关注
基于前三季度的良好表现,IDC预计2025年中国折叠屏手机市场出货量将接近千万台,延续此前持续增长的趋势。 机构指出,折叠屏手机正成为智能手机市场的全新增长极,2025年全球出货量预计达5470万台,中国市…

2025-11-12

联想双十一成绩亮眼:89亿销售额揽19冠 平板与多品类齐发力
不仅一举夺得笔记本电脑总榜自营销量冠军与POP销售额冠军,更在细分品类中实现了多维度领跑。旗下的ThinkPad与ThinkBook分别拿下POP销售额冠军与自营高端销售额冠军;游戏本方面,联想更是包揽了自营…

2025-11-12

2025年Q3中国折叠屏手机回暖:出货量增17.8\% 体验升级或成高端市场关键赛道
【环球网科技综合报道】11月11日消息,根据IDC最新手机季度跟踪报告显示,2025年第三季度,中国折叠屏手机市场迎来显著回暖,该季度出货量达到263万台,同比增长17.8%。市场动能的恢复,一方面得益于手机…

2025-11-11

取消实体卡槽换来长续航!纯eSIM版iPhone17 Pro多场景续航表现亮眼
在美国、加拿大、日本等特定市场销售的纯 eSIM 版本,由于取消了实体 SIM卡槽,获得了更大的电池空间,续航表现明显优于实体卡槽版本。在综合活跃使用测试中,eSIM 版续航达 16 小时 12 分钟,比实…

2025-11-11

荣耀400系列发货量破600万创佳绩 荣耀500系列新设计蓄势待发
在海外首发时,销量就达到前代产品的2-3倍。在中国市场上,荣耀400系列首销日销量同比荣耀300系列增长195%,同比荣耀200系列增长138%,打破近三年荣耀手机首销日销量纪录。6月30日,该系列全球累计激…

2025-11-11