端侧AI芯片的竞争正围绕NPU算力展开,各大厂商不断刷新TOPS数字,将有限的晶体管资源尽可能投入到Transformer加速单元中。然而,诚恒微在无锡举行的CH37系列边端侧AI SoC产品发布会上,却给出了一个截然不同的产品定义思路。其首款旗舰SoC CH3715在搭载六核NPU的同时,还集成了四核GPGPU,这一“非典型”组合迅速引发行业关注。
诚恒微CEO楚立斌向雷峰网透露,CH3715的产品定义始于2022年,当时ChatGPT尚未发布,具身智能也并非芯片行业的热点。团队首先观察到的是机器视觉、雷达、工业设备中长期未被单颗芯片满足的需求:这些场景既需要AI算力,也需要高精度计算、图像处理和低时延,客户往往只能通过多颗芯片拼凑系统。CH3715的目标正是将这些分散的计算能力整合进一颗SoC,实现“异构计算,一体架构”。
具体规格上,CH3715集成了10核CPU(含4大4小主核及2个800MHz的R8实时控制核)、自研渲染GPU(358 GFLOPS)、六核NPU(48 TOPS INT8/24 TOPS FP16)、四核GPGPU(1 TFLOPS FP32,兼容CUDA生态)、双核DSP及自研FFT硬件加速器。楚立斌解释,NPU擅长神经网络推理,但真实设备还需处理大量传统计算——复杂视觉算法需要更高精度浮点运算,雷达需要FFT信号处理,机器人涉及几何计算与实时控制。仅靠INT8精度的NPU无法覆盖全部算法,GPGPU的灵活性与低迁移成本恰好弥补这一短板。
这一架构选择折射出端侧AI的真实挑战:设备面对的从来不是单一计算任务,而是一组同时存在的异构负载。若仍由不同芯片分工,数据跨芯片搬运将增加带宽、功耗和时延,独立软件工具链也会推高系统集成成本。CH3715将NPU、GPGPU、DSP、ISP与CPU融合,让数据在片内流转,从底层降低端到端时延。对开发者而言,GPGPU兼容CUDA生态意味着现有并行计算代码可快速迁移,无需为NPU重写全部算法,这在实际部署中极具吸引力。
从产业视角看,诚恒微的选择并非逆潮流而动,而是对“端侧AI=NPU”叙事的必要修正。随着大模型下沉至手机、PC、机器人等终端,Transformer加速固然关键,但真实世界的感知、控制与信号处理仍需通用并行计算支撑。CH3715的发布提示行业:端侧AI芯片的竞争正从单一算力指标转向异构计算能力的综合优化。未来,能否在有限功耗与面积内平衡NPU与GPGPU的资源配置,或将成为衡量端侧AI芯片设计实力的新标尺。诚恒微以首款旗舰产品押注这一方向,其市场表现值得持续观察。
