
+ k/ O. n9 D) L- r- S! Q' S+ q! \+ v/ q ^1 }, l
# ^& R# q. H# z: Z8 [
10月23日,在北京召开的2019 Arm技术峰会上,Arm正式发布了全新的Ethos-N77/N57/N37系列NPU IP,进一步加码人工智能(AI)计算。与此同时,Arm还推出了针对主流移动游戏市场的高能效的Mali G57 GPU和针对主流及入门级市场的单位面积最高效的Mali-D37 DPU。
2 O5 M# [+ `: s. j# g5 r' e# U5 I) s
g# _- J% a7 e: H( J
ARMv8及后续架构将不受限制的继续支持中国合作伙伴!. }& U# {2 d$ M `2 a
% s/ {4 g/ B+ T, B; B& u' o2 w! O' {& V' t: ~" N; G
今年9月25日,Arm中国在深圳召开媒体沟通会,针对此前外界盛传的“Arm断供华为”一事,Arm表示与华为仍是合作伙伴,ARMv8及后续V9指令集可继续授权!
+ _( N% C# X" s( Y6 U# U4 A5 l6 X: R& m- O/ W( E f% u- k4 I
- \3 a" k. x( q: q8 G; z$ M
10月23日,在2019 Arm技术峰会北京站上,Arm董事长兼CEO吴雄昂在开场致辞当中再度重申,经过法务严谨的调查及相关调整,目前无论是ARMv8,还是后续的V9架构都是源自英国的技术,将可不受限制的继续支持中国的合作伙伴! C1 U2 `# S; x9 |% _7 ? \/ Q
" S, F) k* y$ B$ f" I6 J7 |
2 P' B8 h( u3 ?. F ! m% a* ^- [, m
# ?4 h* ]0 c) m4 Y+ M0 H. j0 b
* O, Q; A, H8 c) A% y此外,吴雄昂还指出,Arm在中国的合作伙伴已经超过200家,中国合作伙伴出货的基于Arm架构的芯片已超过了160亿颗,国产SoC芯片95%都是基于Arm架构的。" F4 h0 n4 O2 E. H
1 Y7 N7 u7 \8 Z- Z6 S3 H+ ~; |' K; S
吴雄昂强调,Arm是唯一非源于美国的主流计算架构。Arm中国承接Arm在中国的业务和技术,在Arm标准之下自主创新、赋能产能,把中国工程师能力调动起来打造知识产权。这些知识产权将不只是提供给中国产业,还要通过统一标准面向全球。
8 Y2 T; n$ q' w+ s4 r; P1 e% p
* c1 A3 X3 L) l6 ] J5 L* d6 q6 l- ?# z; k, p" N
加码AI计算,Arm发布Ethos系列NPU IP
0 z2 V0 M( t" |: l7 p6 x( r: }0 K- j" u1 L. ^0 X' i
/ y: a) A E6 ~* I( \
根据Arm及研究机构的预计,到 2028 年,移动设备的数量将从现在的17亿台增长到 22 亿台,智能的IP Camera将由现在的1.6亿台增长到13亿台。在终端侧具有人工智能的设备将会由现在的3亿台增长到32亿台。足见人工智能市场增长之迅速。
& H8 A- h0 C6 h5 b. O7 d" r7 l# {' ?1 Z4 |2 S) {: _
) S. d# o6 d5 p1 W5 `9 t5 U而随着AI技术的兴起和广泛应用,AI对于芯片的算力也提出了更高的要求。作为全球最大的处理器IP供应商,Arm的Cortex CPU和Mali GPU在以智能手机为代表的移动终端市场占据了极大的市场份额,但是在AI计算领域,Arm此前一直都是依托于其Cortex CPU、Mali GPU及相关软件开发工具来提升其AI计算的能力。3 K! P, v' m3 g# S4 @7 V2 M$ P
! [9 E+ I& ^0 y
- |- h/ c6 z0 a4 H
但是,传统的CPU、GPU核心并不是AI计算的最佳载体。因此越来越多的芯片厂商开始推出了AI专用芯片,或者在SoC当中加入AI计算专用的NPU内核。比如华为2017年就率先推出了集成NPU内核的麒麟970处理器,同时苹果推出的A11处理器也首次集成了NPU内核。此后,高通、联发科、三星、展锐等手机芯片厂商也纷纷开始在SoC当中集成自己的NPU内核。
. C" A; m& u+ E( m( m- w) @
! S# q- ]0 g! p! C v
8 F% }) h" Y& P0 j9 R在此趋势之下,为了应对市场对于AI内核的需求,Arm在2018年年初也公布了针对AI的Project Trillium项目,其中就包括了全新的机器学习处理器IP、目标检测处理器IP和神经网络软件库。经过了近两年的时间,现在Project Trillium项目的成果也开始正式产品化。6 d- T7 {4 {! n2 m \
" E# B- h; j4 s( ^, @1 Q- f
2 m+ Y* N1 d- k) p7 K0 M T' l
# ^9 s% U2 K8 b5 Z8 g" n4 c
6 z) C7 u/ ` z' E; F$ A5 {3 ^& {. i9 n# @9 e
0 N- ^: o/ }$ v
8 n5 x) @' m- @) a今天,Arm市场营销副总裁Ian Smythe 在Arm技术峰会上正式发布了全新的Ethos系列NPU IP,包括针对高端市场的Ethos-N77、针对主流市场的Ethos-N57和低端市场的Ethos-N37。
& \5 [( o/ H; G$ P
& D9 S' J# K' s/ T4 H
+ J1 D8 J4 \& ]( ?$ I 8 L. ? J9 [2 \2 ~ W
* X3 y5 F! z9 f# _7 W+ N6 ]2 D2 y; ^
B6 B% c7 n& F7 W
1 Y" S' \. d9 H8 h
Ethos-N77实际上就是Arm去年公布的Project Trillium项目中的那款机器学习处理器IP,其内部集成了可配置的1-4MB的SRAM,在1GHz主频下,7nm工艺下,可以提供最高4 TOPS的AI算力,每瓦性能高达5 TOP。另外,之前Project Trillium项目公布的数据显示,Ethos-N77的单位面积算力为4.6 TOPs/mm²(最新发布的可能有进一步提升)。那么Ethos-N77的这个性能在市场上处于什么水平呢?: \! g! u0 W- s) u0 G

2 t. N$ W* F8 Y+ g根据资料显示,华为麒麟970 NPU是基于寒武纪1A IP,算力是1.92TOPS。而苹果A11的NPU算力仅为0.6 TOPS,A12的NPU性能为5TOPS。而根据此前高通骁龙855发布之时的数据显示,其整体(包括CPU+GPU+DSP等)的AI算力(超过7 TOPS)是华为麒麟980的两倍,照此估算的话,麒麟980的NPU性能大概在3.5 TOPS左右。另外据芯智讯了解,华为麒麟980的NPU是基于寒武纪IH8,是针对低功耗场景视觉领域的NPU内核IP,而寒武纪IH8有 4 种可选的配置1T、2T、4T、8T OPS@1GHz,麒麟980应该是4TOPS的版本。而麒麟990系列的NPU并未公布具体的OPS数据,不过其采用了全新的达芬奇架构以及两个大核+一个小核的配置,性能应该更强。+ U: ~5 r: N3 S4 k( D
! K T/ m& n7 H/ B u/ _7 Z6 a1 ^
8 x# h1 ]9 d- x% g! D& p# U/ K1 k1 x, W
在单位面积的算力方面,根据芯智讯此前的估算,麒麟970的NPU的单位面积性能大概是1.48 TOPs/mm²,而麒麟980和990没有相应数据可以参考。而根据TechInsights的拆解,苹果A12的NPU内核的面积为5.79mm²,也就是说苹果A12的NPU的单位面积算力约为0.86TOPS/mm²。
- t4 A" y: ?) _+ p$ K% r1 k- s7 X
# j% N# i9 s: R/ z
在每瓦算力方面,华为公布的资料显示,麒麟810的每瓦算力可以达到6TOPS。苹果的NPU未有相应数据。寒武纪新的NPU内核1M在7nm下每瓦性能为5TOPS。
* U* D, v7 e0 I$ Z$ \* H
$ c8 {) g0 x; V5 t& L5 P& t0 \3 q4 k) P- C( \' G6 Q7 G0 O1 j4 q
从上面的数据对比来看,Ethos-N77的AI性能与苹果A12和麒麟980的NPU相当,相比麒麟990系列的NPU性能可能要弱一些。在单位面积算力方面,远高于苹果A12和麒麟970的NPU。在每瓦算力方面,也是远高于苹果A12的NPU,略低于麒麟810。综合来看,Arm Ethos-N77各方面都还是比较出色的,达到了目前旗舰级NPU的水准。
: V+ H$ V( s5 `3 d9 S, o# r& I2 i4 |
+ t. @+ h* ]' a! \ X9 C. T+ k% u
9 o6 j& {" a! [0 S需要指出的是,4 TOPS的性能是单个Ethos-N77核心在1GHz主频下的性能,如果配置双核的话,那么性能无疑将进一步提升,当然功耗和面积会进一步提升。
+ I+ k$ \6 l# \2 S" z8 \" r; v5 Z: O5 I' ^0 o
. ~9 p6 N$ X% T+ F/ w7 p1 X7 Q) H! W0 UArm此前就表示,Ethos系列IP是具有高可扩展性、兼容性和可编程的,可以提供计算性能最低从2 GOPS到超过70 TOPS的产品。$ ^0 F9 C: H; S6 p
N4 P/ N' \$ |" m% \5 O4 K# g
/ E) W: X1 |. [9 m6 w& v
另外,Arm还推出了针对主流市场的Ethos-N57,内置了512KB SRAM,在1GHz主频下,算力最高可达2TOPS;而针对低端市场的Ethos-N37,是为了提供面积最小的ML推论处理器(小于1mm²)而设计,其同样也内置了512KB SRAM,在1GHz主频下,算力可达1TOPS。# L/ ~, U5 F. T7 b8 ]1 w; ?
9 E* ^2 w8 Z! b
2 c1 F( x7 B* m4 U, p/ aArm表示,Ethos-N57和Ethos-N37针对Int8与Int16数据类型的支持性进行了优化,通过如创新的Winograd技术的落地,使性能比同类NPU提升超过200%,并且配备了先进的数据管理技术,以减少数据的移动与相关的耗电,在ML在性能与成本、面积、带宽与电池寿命之间达成了比较好的平衡。
0 j7 O# h9 C5 ?) x2 X! b0 g+ n+ [9 k! X0 b9 ?) C2 ]
, J* h" d+ P5 g
据芯智讯了解,除了移动市场之外,Arm的Ethos系列IP未来也将会开始进入物联网、工业、汽车、网络以及服务器市场。
# Q* Z( Z1 o+ \: k0 o8 n# K: V |; n$ g
& T/ F1 C: ?* c+ e开源的AI开发框架Arm NN
8 |* @+ X; P# u0 G! S( M6 o; o' }- s6 H/ [! a2 m- z+ b
# J% b q& q. Z; N3 ^7 S1 w1 O
我们都知道,此前高通骁龙845/855系列都并未内置专门的NPU内核,但是其仍然提供了较高的AI能力,而这一切得益于其神经网络引擎Neural Processing Engine的助力。即采用更为弹性的异构的机器学习架构,在通用平台内做内核优化,使得AI计算合理的分布在CPU、GPU、DSP等每个单元上,从而可以针对不同移动终端提供弹性调用各个处理单元来进行AI计算。
) J P( T. `5 `/ N5 F
0 k, `' M& N( s0 d) M' B4 C3 F" B
而Arm此次在发布Ethos系列NPU IP的同时,也推出了开源AI开发框架Arm NN,强化异构的AI计算,进一步提升整体的AI性能。; q7 z5 u" a1 o# z
2 v; K) t# y% A% M% l3 f9 j
2 w! B; P7 h2 n# C l

R0 x# F( O6 |, V2 r( r- R1 d" \) L3 v% ^: Q
; P, x: D: s! _( z
据介绍,Arm NN是属于偏底层的架构,而且在其基础之上,可以支持其他的更高层级第三方的NN框架,并提供完整工具链,可实现在AI计算上对于Arm CPU/GPU/NPU内核的合理调用,实现更高效的异构的AI计算。
* Z2 Y M4 W0 y/ s
( f0 g. y' s2 }) g5 X; T$ ]$ x9 i2 S/ \$ `2 S' Z* \- C5 J
Arm表示,由于不同的SoC对于AI的加速方法是不一样的,因此第三方应用及开发者要用到片上系统的加速能力是比较困难的。而开源的Arm NN的推出,将降低开发者调用Arm内核的难度,进一步提升开发人员的体验。
1 o% y" k6 j2 ^4 F/ C& h* K7 P7 I5 j# d0 |: c! g7 K
: @- ], q. A4 V( j0 z
. X. `' O* o: |+ G
8 ?& p3 Y4 M0 Q& H: o1 ~$ r U9 f
1 E8 t4 H4 U% y0 R; _# M5 J此外,为了推进基于Arm NN的内容创建和开发,Arm还与Unity(Unity最目前主要的3D引擎,50%的3D游戏,75%的VR内容都是基于Unity引擎开发)达成合作,进一步优化Unity引擎,使得基于Unity的开发者能够更容易的访问和更高效的利用Arm的内核,在Arm CPU/GPU/NPU之间获得更好的性能。可以实现一次开发,即可获得Arm全系列的内核的支持(即可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。+ h9 G0 p. n: y& |! \3 u
& C6 |# g( n/ P
- |9 Y+ ~, r7 \9 x5 qMali G57 GPU:为主流市场带来智能与沉浸式体验* _+ [4 N* h- ~; c) e; \
& E, y' d8 s) m. w
' v3 W5 V3 n! v& f+ G- v, R今年6月,Arm针对高端市场推出了首款基于全新Valhall架构的GPU——Mali-G77。今天,Arm针对游戏市场推出了第二款基于Valhall架构的高性能、高能效的GPU内核——Mali-G57。(Vahall架构进一步提升了并行执行的能力,同时在代码上也做了尽量的简化,从编译角度来讲也更加友好。) ? Z1 {- N0 r: @4 C2 |: S, n# j
; k* w7 ]1 ~' W" k9 g% M3 j( j" C! X. Z
+ U' z b4 X6 ?) r$ p
J" S* ]- Y3 V, j
, o: [; H* D8 e5 h6 ` |% @. y* ^' Q$ P. Q# Z
据介绍,Mali-G57的性能相比上一代的Mali-G52在能效上提升了30%,性能密度提升了30%,机器学习性能提升了60%。并且Mali-G57还加入了针对虚拟现实(VR)提供注视点渲染支持,再加上机器学习性能的提升,可以支持更复杂的XR实境应用。而且,Mali-G57还支持1-6个核心的配置,可以满足不同市场定位的智能手机的需求。% }$ n: J i, v, |
' V4 J- F: J+ A8 B( ^5 S3 D7 h
6 y) ?8 q7 \" E/ ]
Arm表示,Mali-G57可以将优质的智能与沉浸式体验带到主流市场,包括高保真游戏、媲美电玩主机的移动设备图型效果、DTV的4K/8K用户接口,以及更为复杂的虚拟现实和增强现实的负荷。' c( ?3 n: A, v* _& t& t
# \/ l. V0 d8 q/ X7 x2 d$ v8 s
; ~3 p+ g- K: l
Mali-D37:Arm单位面积效率最高的DPU
6 M n) S* H& ^5 l9 J
9 C. _! L- N; y1 v; v
" q0 ~1 |0 r/ U6 h在今天的技术论坛上,Arm还推出了目前单位面积最高效的显示处理器Mali-D37。" p7 W& q) U1 d- K! k
8 Q$ f4 Y M. \5 L' k
" C, U8 a0 l4 g- U& Y* r

0 O" u8 Q. f) v* F4 r* f6 @7 s: J7 I+ ^9 l% k
% L9 D0 q8 g. H& i$ w; H
据介绍,Mali-D37是Arm第一个面向主流市场的基于Komeda架构DPU,拥有极高的单位面积效率,在支持全高清(Full HD)与2K分辨率的组态下,16nm制程的面积将小于1mm²。
' C5 B7 @* I" R3 I s; J: R5 N: `7 A2 [* d# o6 `
% d( T7 H; f/ o0 f9 T9 M6 H( r' u在性能方面,Mali-D37保留了高阶的Mali-D71关键的显示功能,包括与Assertive Display 5结合使用后,可混合显示高动态对比(HDR)与标准动态对比(SDR)的合成内容。另外,Mali-D37其通过将部分GPU核心显示的工作负载卸载到Mali-D37来工作,以减少GPU的工作以及对于内存的访问,使得系统的功耗可以降低30%。* \7 r, O# z- v# s6 e
( J t+ j; g( z! H9 \ m4 S
+ A' o q! W$ I8 _1 O) k" A% [
Arm表示,Mali-D37可以支持入门级智能手机、平板电脑等成本较低的设备,获得2K级别的视觉效果与性能支持。& c' \. C4 \% u* }1 u/ p% B
- O; ^5 m- z/ `2 B2 r. H! y* `5 y
. c6 G3 E3 d& V, vArm的通用型NPU能否获得成功?
3 o |% n: N! x8 V. ?! ~% H2 |0 @& I3 G0 b
5 O/ `( ~( m# d
从目前的市场趋势来看,AI芯片正越来越向专用化的方向发展,越来越多的算法厂商也都纷纷基于自身的算法推出了自己的AI芯片。同样,正如前面我们所提到的,目前华为、苹果、高通、三星、展锐等众多的手机芯片厂商也都有推出自己的NPU内核。那么Arm的“通用型”的Ethos NPU IP真的有市场吗?
x* G/ O2 Y ^. z1 S" I: F: m0 X$ `( ^
. G% U/ ]+ _% H( w! K( b对此,Arm市场营销副总裁Ian Smythe表示,Arm的Ethos NPU IP并不是孤立存在的,其主要的优势在于,在其本身提供出色的AI性能的同时,可以更好与Arm的CPU、GPU进行协同,以实现异构的AI计算,从而进一步提升整个系统层级的AI性能、降低功耗。而且,目前AI市场还是在初期,很多的AI算法仍在快速迭代,选择“通用型”的NPU是比较安全的做法。; j6 K! g; q5 w
0 C7 k. E- ^9 k0 s
- j l% w; W/ `& {/ ?, l+ ?
/ R1 t w) k& C1 J3 W) T3 ~
; l' T+ i/ }% @6 @- H
6 X Y0 j9 M a% `$ P% A, E
在采访当中,Ian Smythe向芯智讯确认,Arm的Ethos NPU IP也可被集成于比如RISC-V等其他架构的SoC当中,但是Ian Smythe也强调,这样并不能发挥出Ethos NPU与其它非Arm CPU/GPU在AI计算上的协同优势。
0 @. i+ n6 n/ {8 Z# e4 g* i; x8 L- P8 P
$ O% c. p* a+ g( K# s @
另外,Arm的Ethos NPU IP还实现了对于高中低阶的全面覆盖,但是目前众多的芯片厂商主要还是在其高端SoC当中集成了NPU,而随着AI计算向边缘侧部署的趋势,未来市场对于NPU的需求也将会越来越大。Ethos NPU IP的推出,将可帮助芯片设计厂商更简单、更低成本的获得不同档位的NPU内核的支持。 \( m" _$ \# q: l& C8 ~+ ?
6 T4 U4 _% s& U$ g9 P5 b* A' i
" B( ]' I* i- C2 e另一方面,目前的Android应用生态基本都是基于Arm架构的处理器,因此,如果采用Arm的Ethos NPU IP,结合开源的Arm NN框架,应用开发者将可以更简单、高效的调用Arm的CPU/GPU/NPU内核,可以为用户带来更为出色的AI体验。而且,可以实现一次开发,即可获得Arm全系列的内核的支持(这也意味着,可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。而对于其他的芯片厂商的NPU来说,开发者要想实现灵活高效的调用NPU,充分发挥其AI性能,则需要针对性的进行优化,而且还需要其提供相应的权限和工具。即便是开发者开发应用实现对于A厂商的NPU调用,同样的应用要想实现对于B厂商NPU的调用,可能需要重新进行编译。显然,对于应用开发者来说,Arm的NPU所具备的生态优势无疑是其他厂商所无法比拟的。
8 L7 \: n, U/ f3 ~* V, H+ [) V3 n: o* S7 u6 b# @4 X
4 X; b8 j1 _6 l% [4 u. g4 U
最后,Ian Smythe强调,Arm对于AI性能的提升是多维度的,一方面会持续推出更高性能的NPU IP,同时也在不断提升Arm CPU/GPU的AI性能。 W$ w( z6 ]9 a2 K, F y* b+ @* q
9 E: e: f5 U: s8 E, n: w
2 u4 ~; d, n" W) G3 N5 e
* G+ d1 a( e, f. c) L& [6 s$ \1 M: |% n! b
; y3 \) A) @; O, z$ `0 ~) ?% V; q
值得一提的是,Ian Smythe在演讲当中透露,Arm在下下一代的大核架构Matterhorn当中,加入Matrix Multiple(MatMul),令其ML(机器学习)性能与前代CPU相比提升一倍。
2 H( [, u& n5 M4 `/ u
' c5 E: [ z- ~0 R! [( Q" }3 }) O9 T2 ]& r+ A4 E. y
编辑:芯智讯-浪客剑* `9 J. \/ R: `9 w2 y9 X. |8 ^* h
往期精彩文章7 s0 k8 F& J( R- Z
VR市场迎来第二春:5G+VR云化将成最大推力!% s3 \( B( `9 W* i, V/ W) C
1 w- J3 c0 \( D9 Z0 a! y/ \ z9 f
2019生物识别论坛成功落幕:这十大看点不容错过!
1 }, N4 ^( [4 p& q阿里平头哥正式开源RISC-V架构MCU芯片平台
4 J. X0 v2 \( ]# v- T% a首度杀入3D人脸识别门锁/门禁市场,英特尔为何选择与小钴科技结盟?7 |) w* V. ?/ ]" Z$ S& @
7 i3 y O% W2 Y# K/ z2 f [展锐再推4G功能机芯片虎贲T117,意义何在?6 N8 S% h4 `3 n; J; L2 P
- v) [& W1 j+ c- a历史首次!华为海思4G芯片Balong 711对外销售!
7 \6 k$ J: J6 F u0 `- C2 G) S
& ]6 A% q6 | O: a7 D8 `不惧美国打压!华为已获得65份5G商用合同,5G基站发货超40万个!& z$ P2 A' L! f1 p, Z8 |
/ ~. p; J+ K6 [# L4 t
巨额债务违约+资金链断裂?手机ODM厂商海派关厂裁员!
) z# B2 |3 |+ x0 I& C
: C& i" o r9 J! Z" M6 C; e# S" t可穿戴巨头Fitbit宣布撤出中国!
) k, N+ ^. y( M" j9 J" i0 n) G/ i6 O& ^' R* N% n+ ^/ j5 t5 L9 b
收购Intel基带芯片业务涉嫌违规?苹果遭市监总局启动问询8 p# x3 l8 ]7 ]4 T+ z4 v
/ V, a6 |* X4 v, b, p# H9 K' W
禁令之下,安防巨头海康与大华的应对之策!# y4 @8 ?, a; ?7 K0 m: j- g. v; P4 ?
8 R% o" T' d8 h# s; D% @& }1 X为应对RISC-V挑战?Arm CPU引入自定义指令功能!
% ^/ X# j. _ R' l5 Y行业交流、合作请加微信:icsmart01, K( ?4 s3 F6 X, V1 Z
芯智讯官方交流群:221807116
$ \- Z$ x6 [ ] ]! K7 Z* d
\3 q" d4 f! I来源:http://mp.weixin.qq.com/s?src=11×tamp=1572103805&ver=1936&signature=jeCKwe1UBQzC*Pzs8GoY9TZBvEs1rdMAvR4c22h3Cpdg-qQ*TOrpE2uZ4YvRMx7pQMFu5Q-as9lkvJgPIZqWm1WA-*ncmgAC2Ls6p79VafFsjOW9cM78m6hG7c-lzR2Q&new=19 G4 K5 K/ c3 E+ l1 a' n% @, q) i
免责声明:如果侵犯了您的权益,请联系站长,我们会及时删除侵权内容,谢谢合作! |