卷积神经网络硬件实现综述阅读之——《2019 - A Survey of Convolutional Neural Networks on Edge with Reconfigurable Computing》
Abstract:
在本文中描述了常见的CNN网络的特点、运行CNN网络时的可重构计算的能力、硬件实现可重构CNN网络的最新技术水平,以及边缘可重构平台在未来发展的趋势和挑战。
Introduction:
边缘计算与云端计算的对比:
| 边缘计算 | 云端计算 |
|---|---|
| 低延时 | 高延时 |
| 计算具有时效性 | 计算不具备时效性 |
| 网络传输依赖性低 | 网络传输依赖性高 |
| 特定任务的处理 | 特定应用的处理 |
| 成本低 | 成本高 |
| 分布式难于管理 | 云端位于中心,易于管理 |
| 难以调试(远程) | 容易调试(本地) |
| 计算能力低 | 计算能力高 |
| 能耗受限 | 能耗不受限 |
在本文,分析和讨论了基于可重构设备的架构解决方案,用于边缘设备中的卷积神经网络(CNN)推理。全面介绍了使用可重构设备在边缘部署推理的最新技术。
Reduction of Complexity of CNN Models:
减少存储权重所需的内存和网络推理期间的计算复杂性。CNN 模型的复杂性降低对于在硬件资源和能源有限的边缘设备中部署大型CNN至关重要。已经考虑了两类主要的优化:数据量化和数据缩减。
数据量化是降低用于表示权重和激活(激活函数后的神经元输出)的算术复杂性和位数(位宽)的过程。降低算术复杂性是通过将单精度浮点运算转换为定点、整数甚至2的幂来完成的,以将乘法转换为逻辑移位。在任何这些类型的算术中,用于表示数据的位数都可以减少。自定义浮点表示形式考虑较少的位来表示浮点数据。16位和8位浮点是常用的表示形式。可重构计算的设备可以利用其硬件灵活性来实现具有自定义位宽的优化算术单元。
在(Hardware-oriented Approximation of Convolutional Neural Networks)中,作者已经表明,8 位定点数据表示保证的精度接近于32位浮点获得的精度。
Reconfigurable Computing Architectures for CNN:
在深度学习架构的设计中考虑了两种不同的可重构计算方法:粗粒度和细粒度。粗粒度可重构设备的灵活性较低,可重构性在更高级别可用,而细粒度架构提供门级可重构性,使其高度灵活,但由于与可重构逻辑相关的延迟和面积,成本高于性能。

本文综述了边缘计算中卷积神经网络的可重构计算架构和技术,探讨了减少CNN模型复杂性的方法,如数据量化和数据缩减,并详细介绍了应用于边缘CNN计算的粗粒度和细粒度可重构架构。

3038

被折叠的 条评论
为什么被折叠?



