数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

千问3.8-Max发布:国产模型激战正酣,阿里如何突围制胜?

2026-08-04来源:天脉网编辑:瑞雪

8月初,阿里正式推出Qwen3.8-Max大模型,参数规模高达2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研及长周期任务处理能力。官方宣称,该模型不仅能回答问题,还可调用工具、修改代码,并端到端完成复杂任务。开发者可通过千问AI平台获取API服务,每百万Token输入12元、输出36元,价格处于国产头部模型中间水平。阿里计划开源Qwen3.8系列的27B小尺寸模型,为本地部署和低成本应用提供更多选择。

在7月19日预览版上线时,千问团队便宣称该模型以“天”为单位持续进化,对标Anthropic旗舰模型Fable 5,并称其“可能是除Fable 5外最强大的模型”。然而,实际测试显示,Qwen3.8-Max在科研编程、Agent和办公任务中进步显著,部分项目甚至超越海外旗舰模型,但在真实软件工程和复杂环境操作中仍存在差距。例如,在SWE-bench Pro测试中,Qwen3.8-Max得分为67.7分,比Fable 5低12.3分,也略低于Claude Opus 4.8的69.2分。

第三方榜单Arena的成绩也反映了类似情况。Qwen3.8-Max在视觉和文本榜单上分别排名第二和第五,与榜首相差13分;在前端代码榜单中排名第四,比榜首的Opus 5-Max低37分。尽管官方编程基准成绩较好,但Arena榜单更侧重生成结果的视觉效果、交互完成度和用户偏好,因此Qwen3.8-Max未能登顶并不矛盾。长周期任务是Qwen3.8-Max的亮点之一,例如连续运行约16天从零构建开源项目oh-my-cli,但连续运行16天仍不足以证明长周期能力已完全成熟,还需考察其目标一致性、错误发现和恢复能力。

千问系列模型一直成绩亮眼。5月20日发布的Qwen3.7-Max曾在Code Arena排名第四,Text Arena排名第六。然而,实际使用中开发者反馈不一。开发者艾林认为,Qwen3.7-Max对项目理解清晰,但在处理复杂代码时易出现漏洞。新一代Qwen3.8-Max在任务拆解、Agent调用和需求理解上有所提升,但与Fable系列仍有差距。独立开发者李默测试后表示,Qwen3.8-Max已接近第一梯队门槛,但在生成交互网站时存在核心功能未完整实现、HTML标签直接显示等问题,需将要求拆解得非常具体才能执行到位。

与国内近期发布的新模型相比,Qwen3.8-Max在与Kimi K3的对比中,仅在工作流智能体任务上超过对方,其余项目多数落后,尤其在深度软件工程和前沿工程任务中差距较大。与DeepSeek V4 Flash的对比则更多反映定位差异,Qwen3.8-Max在所有可比项目中均占优势,但轻量模型V4 Flash以更低成本取得“够用”成绩,挑战了中间价位旗舰模型的价值。开发者李默认为,Qwen3.8-Max在长上下文和复杂任务上的提升“实打实”,但代码能力仍弱于GLM 5.2和Kimi K3,尚未稳定排进第一梯队前列。

阿里面临的竞争环境愈发复杂。过去,架构创新、更长的上下文或更低的API价格可能成为模型卖点,但如今这些能力正在快速普及,MoE架构、百万Token上下文、智能体编程、多模态和开放权重几乎成为国产头部模型的共同方向。对手动作也越来越快,Kimi K3在复杂软件工程和长周期任务中表现突出,DeepSeek V4以低价和推理效率吸引开发者,GLM 5.2则凭借编程能力获得海外开发者认可。技术路线趋同下,单个模型难以建立长期壁垒,竞争转向谁能持续推出更强模型并降低推理成本。

API定价策略反映了四家的不同思路。Kimi K3走高价旗舰路线,DeepSeek V4-Pro用低价争夺调用量,Qwen3.8-Max与GLM 5.2处于中间档位,但千问输入、输出价格均高于智谱,不占价格优势。对于编程和Agent任务,Token单价只是成本一部分,任务成功率、重试次数和人工接管成本往往更影响总成本。低价模型若频繁理解错需求,节省的调用费用可能被检查和返工成本抵消;高价模型若能一次完成任务,综合成本反而可能更低。因此,Qwen3.8-Max需证明其完成同一项任务时能带来更低综合成本。

阿里的独特优势在于模型之外的完整生态。在模型层面,阿里已覆盖通用语言、编程、数学、视觉、语音、全模态和视频生成,并延伸至世界模型和具身智能,企业可在同一平台组合不同模型。在产品层面,阿里拥有云计算、模型开发平台、钉钉、淘宝及大量企业客户,模型可直接接入办公、电商、客服、营销和软件开发场景。发布当天,阿里旗下企业级Agent产品“千问办公”同步开启公测,模型能力正被直接装进办公场景。阿里披露,Qwen在国内企业级大模型调用市场排名第一,阿里云也位居国内AI云市场第一。然而,生态不能替代模型能力,企业倾向于在同一系统中调用多个模型,哪个效果更好、价格更低就用哪个。若千问长期落后于第一梯队,云和渠道只能延缓用户流失,无法消除能力差距。阿里的竞争力仍存在,但壁垒已非某一款Qwen模型,模型能力决定入场资格,价格决定开发者尝试意愿,云服务和企业生态则决定客户是否长期留下。

AI人才争夺战白热化:Anthropic CEO忧心员工逐利忘使命 行业人才流动引关注
IT之家 8 月 4 日消息,外媒 Axios 昨天发布一篇 AI 人才争夺战的报道,称顶尖 AI 研究员仍在各大 AI实验室间频繁跳槽,但是这些公司非常难留住人才。 据知情人士透露,Anthropic 首…

2026-08-04

新一期期货公司高管测试结果揭晓 15人过关 两公司拟迎新董事长
8月4日,中国期货业协会公布了新一期期货公司高管人员专业能力水平评价测试合格人员名单,共15人通过测试。其中,2家公司拟调整董事长,1家公司拟调整监事会主席。 上述名单显示,铜冠金源期货有限公司拟任董事长温玥…

2026-08-04

影石Insta360加速AI布局,Go Ultra系列将接入阿里千问实现语音播报新体验
知情人士透露,双方采用自研 + 大厂模型融合的合作模式:该 AI 语音助手以影石自研为核心,融合了阿里千问的多模态模型能力。IT之家注意到,影石 Insta360 官方于 7 月 31 日宣布,影石 Go…

2026-08-04

安谋科技All in AI战略加速跑:四大产品线迭代,三大业务线成果斐然
我们看到,从边缘、物理到云端,安谋科技持续引入Arm在这三大业务领域的前沿技术,同时深耕本土创新,自研IP与Arm技术创新互补,构筑异构计算平台,给智能体时代AI落地打造坚实的算力基石。 纵观四大产品线、三…

2026-08-04

小米REDMI 17 5G手机渲染图来袭:三色可选 超大电池+高性能芯片引关注
IT之家 8 月 4 日消息,科技媒体 91Mobile 昨日(8 月 3 日)发布博文,分享了一组渲染图,展示了橙色、黑色和蓝色 3种颜色的小米 REDMI 17 5G 手机。尺寸方面,小米 REDMI …

2026-08-04

潮汕家族资本版图再扩张:立讯精密后立景创新叩响港交所大门
然而,真正让市场瞩目的,不是立景创新“全球第二”的市场地位,也不是它年入347亿元的营收规模,而是它背后那个熟悉的潮汕家族。2018年,王来喜离开立讯精密,通过立景有限公司在广州创立了立景创新。 更值得关注…

2026-08-04

屹晶微冲刺北交所IPO:董事长黄米龙高中学历 持股超四成控股近六成
瑞财经 王敏7月31日,浙江屹晶微电子股份有限公司(以下简称“屹晶微”)在浙江证监局完成IPO辅导备案登记,拟北交所上市,辅导机构为兴业证券。 屹晶微成立于2021年12月,注册资本3174.6万元,是…

2026-08-04

谢勇续掌我爱我家帅印12年:业绩股价双承压,未来路在何方?
从盈利能力来看,近年来公司毛利率波动下滑,2025年公司毛利率为9.23%,处于较低水平,和2015年的29.54%相去甚远。 我爱我家2026年一季报显示,一季度公司营业收入为21.61亿元,同比下降23…

2026-08-04

两千美元撬动数学新突破:AI批量解谜,数学研究奇点时刻来临?
。简单来说,过去AI更像是在数学家绘制好的地图上寻找道路,而这一次,它开始尝试进入没有地图的区域,从“解决数学问题”走向“参与建立数学理论”。Astra这次给出了高维球堆积密度的新上界,逼近了著名的线性规划界…

2026-08-04

OpenAI新模型Astra攻克10道数学难题成本2000美元 学术规范隐忧浮现
该模型为高维球体最密堆积问题提出了新的上限,证明了“非sofic群”的存在,并在与后量子密码学密切相关的“最近向量问题”上取得进展。2026年6月,数百名数学家在首份《人工智能与数学莱顿宣言》中警告称,人工智…

2026-08-04