边缘AI场景下的高性能与低功耗推理实现(上)
近年来,人工智能(AI)的应用场景正在经历深刻变革。传统模式下,终端设备采集传感器数据并上传至云端进行推理处理,再将结果返回终端。这种模式对网络带宽提出了极高要求,尤其在数据量庞大的情况下。
随着边缘计算技术的发展,AI推理逐渐向边缘设备迁移。这种方式不仅能够实现更快速的实时响应,还能在一定程度上提升数据的安全性和隐私保护。同时,它还有效减少了云端连接的延迟与通信成本。对于依赖电池供电的物联网设备而言,低功耗也是其关键优势之一。因此,边缘AI具备自主性、低延迟、低能耗、低成本以及更高的安全性,正成为众多新兴应用的理想选择。
图 1:AI推理从云端向边缘迁移
在边缘AI设备中,微控制器单元(MCU)正扮演着越来越重要的角色。相较于微处理器(MPU),MCU具备更佳的实时响应能力、更低的功耗与成本,同时提供高度集成的解决方案,有助于简化设计流程并降低开发与物料成本。因此,MCU成为低功耗与经济型边缘AI应用的理想选择。
目前,一些高性能MCU已集成硬件加速器,能够高效处理神经网络所需的线性代数运算,如点积、快速并行矩阵乘法、卷积和转置等。此外,针对资源受限的MCU平台,还推出了优化的轻量级神经网络模型、软件库及配套开发生态系统。
RA8P1 AI加速MCU助力构建高效AI应用
瑞萨电子最新推出的RA8P1 MCU是其首款配备AI加速功能的单核与双核MCU。该产品集成了高性能的Arm Cortex-M85和M33内核,以及专用的Ethos-U55神经网络处理单元(NPU),特别适用于边缘AI和物联网应用。RA8P1在AI/ML处理、数字信号处理(DSP)以及标量运算性能方面均表现出色,同时满足低功耗需求。
RA8P1采用先进的台积电22nm ULL工艺制造,提供高达7300+ CoreMark的原始性能,以及256 GOPS的AI算力。结合大容量内存与丰富的外设接口,RA8P1能够在MCU内部直接执行复杂的声音处理、视觉识别以及实时分析任务。
双核架构使其具备更高的处理能力,并支持高效的多任务调度与实时性能优化。此外,RA8P1还集成了高级安全特性,如不可变内存和TrustZone技术,保障AI应用的安全运行。
RA8P1内置的Ethos-U55 NPU是一种专用AI计算单元,专为与CPU协同工作而设计。它能够高效执行神经网络模型中的关键运算,包括矩阵乘法和卷积操作。Ethos-U55特别优化了8位整数运算,从而在降低模型复杂度、内存占用和功耗的同时,保持推理精度。
瑞萨电子已经展示了RA8P1在多个AI/ML应用场景中,相较于CPU内核,Ethos-U55 NPU显著提升了推理性能。
图 2:Ethos-U55 NPU与CPU内核相比展现出更强的AI性能
典型AI模型用例:
- 图像分类:ResNet8、MobileNet v2、MobileNet v3
- 关键词识别:DS-CNN
- 视觉唤醒:MobileNet v1
- 目标检测:Yolo_fastest、Yolov8N
- 异常检测:ad_medium
RUHMI框架助力AI开发提速
RA8P1的AI解决方案采用高度可配置的RUHMI开发框架,为开发者提供完整的工具链,从而加速AI应用的构建。作为瑞萨首个面向MCU和MPU的综合AI框架,RUHMI集成于e2 studio,支持跨框架的模型生成与部署,能够将模型高效转化为MCU友好格式。
RUHMI支持模型优化、量化、编译与格式转换,原生兼容TensorFlow Lite、PyTorch和ONNX等主流机器学习框架,并提供针对RA8P1优化的示例应用和模型。
图 3:基于RUHMI的AI开发工作流程
典型RUHMI工作流程如下:
- 模型优化与编译(离线):输入预先训练的AI模型,通过TensorFlow Lite、PyTorch或ONNX进行量化与优化,分离运算符并编译为MCU可执行的C语言文件。
- 数据采集与预处理:RA8P1从摄像头或麦克风等传感器获取原始数据,由Cortex-M85内核进行预处理。
- 模型在NPU上执行:预处理后的数据与命令流被发送至Ethos-U55 NPU进行模型推理处理。
- 推理输出与后处理:处理结果返回主CPU,进行后续操作和决策。
RA8P1支持的典型AI应用
凭借高推理性能、低功耗与实时处理能力,RA8P1适用于多个行业和边缘场景。
关键应用包括:
- 语音AI:关键词识别、语音识别、语速识别、降噪、说话人识别。
- 视觉AI:目标检测、图像分类、手势识别、人脸识别、图像分析、驾驶员/车辆监控。
- 实时分析:异常检测、振动分析、预测性维护。
- 多模态应用:智能人机界面、增强型监控摄像头、智能机器人等。
在后续部分,我们将通过两个具体应用实例,进一步探讨RA8P1在实际部署中如何简化AI实现过程。