
在大会“算力首创首发”专场上,国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。团队对Transformer结构做PD/AF分离:Prefill预处理阶段与Attention注意力计算交给国产GPU,FFN模块交给类脑芯片。研发团队同时自研了模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合。实测数据落在硬件配置上:3台天数智芯GPU服务器搭配3台类脑机柜,运行DeepSeek V4 Flash模型,相较同等投入规模的纯GPU集群,推理输出和推理能效均提升1倍以上,业务运营成本下降40%以上。项目累计形成15项授权发明专利、6项软件著作权,覆盖异构调度、类脑芯片架构、编译工具链等环节,目前已进入小批量试产阶段。