联系我们
- 地 址:北京市海淀区北四环西路9号 ,主 营:人脸识别,活体检测,身份证识别,银行卡识别,名片识别,车牌识别,OCR识别等及智能识别技术。
- 电 话:13146317170 廖经理
- 传 真:
- 邮 箱:398017534@qq.com
深度学习最近获得的胜利势不可挡:从图像分类和语音辨认到图片标注、了解视觉场景、视频概述、言语翻译、绘画,以至是生成图像、语音、声音和音乐! 随着我们的家变得越来越智能,你会发现许多设备都会需求连续地运用深度学习应用、搜集和处置数据。

所以我们需求新的硬件,一个比 Intel Xeon 所驱动的效劳器愈加高效的硬件。一个英特尔效劳器 CPU 可能会耗费 100-150 瓦功率并需求一个有着冷却安装的超大系统来支持其性能的正常发挥。
图形处置器、GPU
现场可编程的逻辑器件、FPGA(现场可编程门阵列/Field-Programmable Gate Array)
定制芯片、特殊应用型集成电路、ASIC
数字信号处置器、DSP
将来的、外星人创造的、由新的物理定律所开展出的技术
GPU
GPU 最早是为生成基于多边形网络的计算机图形而设计的。在最近几年,由于近来计算机游戏和图形引擎范畴的需求和复杂度需求,GPU 积聚了强大的处置性能。英伟达是 GPU 范畴的领军者,能消费有数千个内核的处置器,这些内核的设计工作效率能够到达 100%。实践上这些处置器也十分适用于运转神经网络和矩阵乘法方面的计算。留意,矩阵向量的乘法运算被以为是「为难的并行(embarrassingly parallel)」,由于它能够经过简单的算法扩展被并行化(它们短少分支因此能够防止缓存信息丧失)。
由于 GPU 的超多核(~3500 个,比照 Intel Xeon 的 16 个/ Xeon Phi 的 32 个),英特尔的 CPU 和英伟达的 GPU 之间的竞争滋长了后者的开展,使其 GPU 比 CPU 在时钟频率快 2~3 倍。GPU 核是更为复杂(分支预测和流程)的 CPU 核的流线型版本,但是前者许多都支持更高级别的并行运算,因此具有更好的性能。
这种 GPU 很擅长锻炼深度学习系统——卷积神经网络或者循环神经网络。它们能够在仅仅几毫秒之内就运转一批 128 或 256 张图像。但是它们同时也会耗费大约 250 瓦的功率并且需求一个完好的计算机来支持运转,这又耗费了额外的 150 瓦的功率。一个高性能的 GPU 系统至少需求耗费 400 瓦的功率。
这并不适用于加强理想眼镜、无人机、手机、挪动设备和小型机器人。以至关于将来的消费级自动驾驶汽车来说也是不可承受的。
英伟达正在努力于开发效率更高的器件,比方 Tegra TX1、TX2(深度神经网络需求 12 瓦的能耗和每秒 ~100 千兆次浮点运算的性能,TX2 需求的更多)和更强大的 Drive PX(250 瓦,与一个 Titan X 的耗费量差不多)。
这里还要留意,在自动驾驶汽车和智能摄像机中,直播视频是必要的而图像批处置是不可能完成的,由于视频需求针对及时响应停止实时处置。
普通 GPU 的程度大约是 5 G-flops/s per W。假如我们想在挪动系统中部署深度学习处理计划,那我们还需求更好的办法!
GPU和CPU
GPU的工作大局部是这样:计算量大,但没什么技术含量,而且要反复很多很屡次。
CPU和GPU由于最初用来处置的任务就不同。
CPU需求很强的通用性来处置各种不同的数据类型,同时又要逻辑判别又会引入大量的分支跳转和中缀的处置。这些都使得CPU的内部构造异常复杂。而GPU面对的则是类型高度统一的、互相无依赖的大范围数据和不需求被打断的纯洁的计算环境。
FPGA
Xilinx 等公司的现代 FPGA 器件就是电子元器件中的乐高。我们能够运用其电路作为模块来构建出整个定制微处置器和复杂的异构系统。而在最近几年,FPGA 开端消费出越来越多的乘累加计算模块。这些 DSP 模块正如其名,可以执行乘法运算并能够被排列到一同来停止一定量的并行运算。
定制 SoC
高通、AMD、ARM、英特尔和英伟达都在努力于将定制化芯片整合进它们的现有处理计划中。Nervana 和 Movidius(目前都在英特尔旗下)曾经或者说正在开发汇合计划。SoC 在同一技术节点上所能提供的性能大约是 FPGA 系统的 10 倍,在特定构造中还要更高。由于 SoC 和处置器所需的功率变得越来越低,其区别未来自于新的汇合内存系统和带宽对外部存储器的有效应用。在这一范畴,整合为 systems-on-a-package(SOP)的 3D memory 至少能够节约 10 倍的功率。
DSP
DSP 曾经存在了很长一段时间,它最初是用来执行矩阵算法的。但到目前为止,DSP 并没能真正提供任何有用的性能或是能够与 GPU 相匹敌的器件。为什么会这样呢?其主要缘由就是核数量。DSP 主要用于电信系统,且无需具有 16 个或 32 个以上的核。其工作负载并不需求这么多。相反,GPU 负载在近 10~15 年间不断在增加,因而它需求更多的核。最终,大约从 2006 年开端,英伟达的 GPU 在性能上就超越了 DSP。
Texas Instruments 公司还在开发 DSP,但是我们从中并没有看到任何有竞争力的性能。且许多 DSP 也曾经被 FPGA 取代了。
Qualcomm 在它们的 SoC 中运用 DSP,并且其性能会有所加速,但是目前还没有足够多的信息来将它与其它的处理计划停止比拟。