人工智能领域正掀起一场前所未有的“造芯运动”。谷歌被曝正在研发代号为“Frozen v2”的服务器芯片,计划将Gemini模型架构直接集成至芯片设计;OpenAI则与博通合作,仅用九个月便完成首款推理芯片Jalapeño的流片。这场由科技巨头主导的硬件竞赛背后,折射出整个行业对算力需求的指数级增长。
在硬件研发如火如荼的同时,资本市场将目光投向了更具现实意义的赛道——AI基础设施优化。数据显示,AI推理平台Baseten年收入增长20倍,估值从21亿美元飙升至130亿美元;Fireworks则在七个月内估值翻四倍,突破175亿美元大关。这个被称作AI Infra的领域,正通过软件优化释放现有硬件的潜在价值,形成新的千亿级市场。
开源推理引擎领域的竞争尤为激烈。vLLM与SGLang两大项目相继完成商业化转型,首轮融资均超亿美元,其投资者名单涵盖英伟达、AMD、英特尔等芯片巨头,以及OpenAI联合创始人约翰·舒尔曼等产业领袖。这种软硬件厂商的深度绑定,标志着AI产业进入协同优化新阶段。
行业重心从模型训练向推理的转移,彻底改变了算力需求特征。卡内基梅隆大学的研究揭示,在典型AI集群中,GPU因系统瓶颈导致的空闲时间占比高达20%,能耗浪费达11%。特别是在推理场景中,Azure Code负载的空闲能耗占比达65%,OpenAI聊天类请求的这一比例也超过50%。这些数据暴露出硬件性能与系统效率之间的巨大落差。
AI Infra的四层架构模型为优化提供了理论框架:能源基础设施层决定硬件运行的稳定性,计算硬件层设定理论算力上限,系统软件层影响计算效率,服务编排层负责资源动态分配。其中,后两层作为“软”优化领域,被证明能带来数倍性能提升。RadixArk技术团队指出,通过软件优化可将GPU利用率从50%提升至90%以上,相当于凭空增加一倍计算资源。
在计算复用领域,SGLang提出的RadixAttention技术通过基数树结构实现跨请求的KV Cache共享。这种创新使智能体场景中系统提示词的缓存利用率提升300%,配合缓存感知调度算法,可将推理请求的缓存命中率提高至85%以上。分布式缓存负载均衡技术则进一步确保请求被定向到存储相关缓存的GPU节点,减少重复计算。
针对GPU空闲问题,行业发展出连续批处理和Prefill/Decode分离两大解决方案。连续批处理技术使GPU吞吐量提升2-4倍,而PD分离架构通过将输入处理与生成阶段拆分到不同GPU集群,使DeepSeek等企业的推理效率提升60%。英伟达最新发布的Dynamo框架,将PD分离作为核心设计原则,SGLang则成为首批支持大规模PD分离部署的推理引擎。
算力释放的突破口集中在低精度计算和投机采样技术。通过将模型权重、激活值等数据转换为FP8等低精度格式,可在不损失精度的情况下释放50%以上显存带宽。投机采样技术借助小模型预生成候选文本,使大模型生成速度提升2-3倍。这些技术需要推理引擎与硬件厂商的深度协同,SGLang已与主流芯片厂商建立联合优化机制,实现新硬件发布即支持。
强化学习的兴起对AI Infra提出全新挑战。这种训练方式需要交替进行推理、评估和参数更新,传统框架在阶段切换时会造成30%以上的算力浪费。RadixArk推出的Miles训练框架,通过将推理和训练集成到统一系统,使强化学习流程的效率提升40%。该框架特别优化了MoE模型的路由策略,解决训练与推理并行策略不一致的行业难题。
开源生态的商业化转型成为行业新趋势。SGLang和vLLM的主创团队相继成立创业公司,获得产业资本战略投资。这种转变源于算力紧缺背景下,开源社区的协作模式已无法满足需求。RadixArk团队提出“AI基础设施即服务”愿景,其技术已能实现新模型发布即支持部署,使开发者无需关注底层硬件差异。
随着黄仁勋牵头成立开源AI联盟,一个涵盖模型公司、芯片厂商和基础设施提供商的新生态正在形成。在这个体系中,推理引擎扮演着“AI操作系统”的角色,连接着不断迭代的开源模型与多样化的硬件平台。这种架构的普及,或将彻底改变AI领域的竞争格局——当基础设施成为公共资源,创新将不再受制于算力门槛。



