诚恒微发布端侧AI芯片CH3715,集成NPU与GPGPU双架构

诚恒微在无锡发布旗舰SoC CH3715,集成六核NPU(48 TOPS INT8)、四核GPGPU(1 TFLOPS FP32,兼容CUDA生态)及自研渲染GPU等。该芯片同时配备NPU和GPGPU,旨在兼顾AI推理与通用计算,满足端侧AI多样化需求。

端侧AI芯片的竞赛正在从单一算力堆叠转向异构计算能力的整合。当大多数厂商将注意力集中在NPU的TOPS数值上时,诚恒微在无锡举行的CH37系列边端侧AI SoC产品发布会上,给出了一个不同的答案。其首款旗舰SoC CH3715不仅搭载了48 TOPS INT8算力的六核NPU,还创新性地集成了四核GPGPU,试图在AI推理与通用计算之间找到平衡点。这一产品定义的背后,是对端侧AI真实应用场景的重新审视。

CH3715的硬件配置颇为全面:10核CPU(含4大4小主核及2个800MHz的R8实时控制核)、自研渲染GPU(358 GFLOPS)、六核NPU(48 TOPS INT8/24 TOPS FP16)、四核GPGPU(1 TFLOPS FP32,兼容CUDA生态)、双核DSP及自研FFT硬件加速器。诚恒微CEO楚立斌透露,该芯片的产品定义始于2022年,彼时ChatGPT尚未发布,具身智能也尚未成为行业热点。团队最初关注的是机器视觉、雷达和工业设备中长期未被单颗芯片满足的需求——这些场景既需要AI算力,也需要高精度计算、图像处理和低时延,传统方案往往需要多颗芯片协同才能完成。

为何一颗端侧AI芯片需要同时拥有NPU和GPGPU?这源于对实际计算负载的深入分析。NPU擅长神经网络推理,但真实设备还面临大量传统计算任务:复杂视觉环境中的算法需要高精度浮点计算,雷达处理依赖FFT和信号处理,机器人除了环境识别还涉及几何计算与实时控制。在部分复杂场景中,仅靠INT8精度无法覆盖全部算法,GPGPU的灵活性和较低迁移成本恰好弥补了这一短板。CH3715的架构分工明确:NPU承担神经网络推理,GPGPU负责高精度可编程并行计算,DSP处理信号,ISP负责图像输入,CPU则统筹任务调度与系统控制。

诚恒微将这套设计理念概括为“异构计算,一体架构”。其核心逻辑在于,端侧AI面对的不是单一计算任务,而是一组同时存在的异构负载。若这些计算仍由不同芯片完成,数据跨芯片搬运将带来带宽、功耗和时延的额外开销,不同平台的软件工具链也会推高系统集成成本。CH3715的尝试,本质上是在一颗SoC上完成计算资源的统一编排,为智能视觉、机器人、工业设备等场景提供更紧凑、更高效的解决方案。这一思路能否获得市场认可,将取决于实际落地表现,但至少为端侧AI芯片的演进提供了值得关注的差异化路径。