国产芯片跑大模型有新解法 性价比翻倍运营成本降四成

用国产芯片把大模型推理成本打下来,是这件事最实在的意义。9月13日,国内首个国产GPU与类脑芯片协同工作的混合推理系统正式亮相,实测显示同等算力下性价比翻倍、运营成本省四成。对普通用户来说,跑在它上面的AI问答、代码生成等应用,未来有望更便宜、更流畅。

9月11日至13日,2026中国算力大会在河北廊坊举行,这套系统在会上正式发布。它由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同打造,是国内首个把国产GPU和类脑芯片组合到一起跑大模型的异构混合推理系统。经DeepSeek V4实测,相较同类国产GPU算力集群,系统性价比提升一倍以上,业务运营成本降低40%以上

它的思路可以概括为“分而治之”:把大模型推理拆成两类任务,Attention注意力计算交给国产GPU,发挥通用计算优势;FFN前馈网络这类延时敏感模块交给类脑芯片,借助存算一体和大容量片上SRAM的架构特点来处理。双方再通过自研的模型编译器、高速互联协议和统一推理引擎,完成任务拆解、协同调度和结果聚合,让两种芯片各干各的擅长事,而不是由单颗GPU包揽全部工作。

这条路线出现的背景,是大模型产业重心正从训练转向推理服务。词元工厂、AI智能体、文生视频等业务对算力吞吐和能耗成本的要求越来越高,传统单GPU架构既要面对内存墙、功耗墙,又受制于先进制程的供给,靠工艺升级堆算力的空间越来越有限,从系统架构层面找出路成了务实选择。央广网报道提到,项目团队在DeepSeek V4 Flash大模型上完成了完整调优验证,推理输出和能效均提升1倍以上。对用户而言,这类国产化推理底座铺开后,最直接的感知可能是AI服务的成本和供给都会改善,金融、安防、通信等对数据安全敏感的行业,也有了全栈国产化的选项。

从追制程到拼架构,国产算力换了一条赛道破局。这套系统能否在Token工厂、AI代码生成、智能制造等场景规模化落地,值得持续关注。

信息来源:IT之家

免责声明:本站转载的文章,版权归原作者所有;旨在传递信息,不代表本站的观点和立场。

上一篇 2026年9月13日 09:52
下一篇 2026年9月13日 16:45

相关推荐