|
|

/ Z- _5 y' H% s0 T
4 Q0 t1 F9 T: x( _# ^% ?7 _2 r
( f5 s+ Q8 @5 x10月23日,在北京召开的2019 Arm技术峰会上,Arm正式发布了全新的Ethos-N77/N57/N37系列NPU IP,进一步加码人工智能(AI)计算。与此同时,Arm还推出了针对主流移动游戏市场的高能效的Mali G57 GPU和针对主流及入门级市场的单位面积最高效的Mali-D37 DPU。
' W' |( N3 E. k! K& b0 h
' _3 W0 {( n' s5 u2 S8 \: `& }( U1 n( Y6 g& R# f' n5 @
ARMv8及后续架构将不受限制的继续支持中国合作伙伴!) F* k- |% u8 a, i4 y `7 h
% R# P" m* ?. _; F" `+ ]/ u9 M: S& P$ g# K; a
今年9月25日,Arm中国在深圳召开媒体沟通会,针对此前外界盛传的“Arm断供华为”一事,Arm表示与华为仍是合作伙伴,ARMv8及后续V9指令集可继续授权!
* c* m6 {8 U ]# C$ f& ]
; Y8 n% G, S! A3 n6 y1 ]8 W) B7 q0 c1 a
10月23日,在2019 Arm技术峰会北京站上,Arm董事长兼CEO吴雄昂在开场致辞当中再度重申,经过法务严谨的调查及相关调整,目前无论是ARMv8,还是后续的V9架构都是源自英国的技术,将可不受限制的继续支持中国的合作伙伴!& f6 Z1 H; J/ S% S
6 } O) P: j# j/ u( [1 @! |
/ n5 e A% g9 u. ?
9 i! r7 j/ q+ v+ d7 f T
: z1 L$ H7 o/ w3 @7 L) Z3 O" p9 R$ C1 g
此外,吴雄昂还指出,Arm在中国的合作伙伴已经超过200家,中国合作伙伴出货的基于Arm架构的芯片已超过了160亿颗,国产SoC芯片95%都是基于Arm架构的。# J$ p& o1 a0 k9 a
# f8 W- z8 v q
0 E& b# m5 X/ p9 W: u0 R! r9 d
吴雄昂强调,Arm是唯一非源于美国的主流计算架构。Arm中国承接Arm在中国的业务和技术,在Arm标准之下自主创新、赋能产能,把中国工程师能力调动起来打造知识产权。这些知识产权将不只是提供给中国产业,还要通过统一标准面向全球。
* ~) Z5 ~5 ^$ S
3 W7 n) L% n9 v2 ~3 B9 N; ?
( H! N- O* h3 B; n' D0 F1 M加码AI计算,Arm发布Ethos系列NPU IP7 N3 l7 Q* E8 D: g
* r% V7 q: k O; m! ?: i2 o2 A
" Y6 d" g& l2 K2 Y2 ^根据Arm及研究机构的预计,到 2028 年,移动设备的数量将从现在的17亿台增长到 22 亿台,智能的IP Camera将由现在的1.6亿台增长到13亿台。在终端侧具有人工智能的设备将会由现在的3亿台增长到32亿台。足见人工智能市场增长之迅速。
3 O( ]. k- Y5 d7 j' u/ E0 {) N
A& z2 U* S6 t! I! M0 S- K9 S- e: I) \+ w5 d6 i! I$ {/ I
而随着AI技术的兴起和广泛应用,AI对于芯片的算力也提出了更高的要求。作为全球最大的处理器IP供应商,Arm的Cortex CPU和Mali GPU在以智能手机为代表的移动终端市场占据了极大的市场份额,但是在AI计算领域,Arm此前一直都是依托于其Cortex CPU、Mali GPU及相关软件开发工具来提升其AI计算的能力。' n* F* r! y9 w$ }: X
( B, i/ _7 } v0 X7 ?
7 j7 r) u& ?: }" g* d但是,传统的CPU、GPU核心并不是AI计算的最佳载体。因此越来越多的芯片厂商开始推出了AI专用芯片,或者在SoC当中加入AI计算专用的NPU内核。比如华为2017年就率先推出了集成NPU内核的麒麟970处理器,同时苹果推出的A11处理器也首次集成了NPU内核。此后,高通、联发科、三星、展锐等手机芯片厂商也纷纷开始在SoC当中集成自己的NPU内核。
4 D6 s+ t( _& W2 U8 j' j5 q y; K. c. z, v
6 ^: Y8 S" Q$ z* l在此趋势之下,为了应对市场对于AI内核的需求,Arm在2018年年初也公布了针对AI的Project Trillium项目,其中就包括了全新的机器学习处理器IP、目标检测处理器IP和神经网络软件库。经过了近两年的时间,现在Project Trillium项目的成果也开始正式产品化。
. d4 F1 E" J) E( x: x" }, P7 ]1 f
8 I$ s1 m+ \7 d; i g% H$ Y' N" U+ T2 ~% Q
. H, r0 @, e! D- g2 q( X/ p& M) g4 m' S
) g2 B# L( T: N. Z. U0 w/ Y4 o$ A* W" w% C* C
2 e' d; R- i& T# p- x1 t今天,Arm市场营销副总裁Ian Smythe 在Arm技术峰会上正式发布了全新的Ethos系列NPU IP,包括针对高端市场的Ethos-N77、针对主流市场的Ethos-N57和低端市场的Ethos-N37。
, p$ v) n2 l7 s& V$ H. E
9 M# ~; z0 G3 c/ ^
7 k/ @$ u, x) O: V M+ W' `9 \/ a( x2 E! K7 ?8 C% H0 E0 E

0 H2 l# A& d3 x [7 e% T, n& [. j- v9 @, x3 K1 D' x' g' c' s
4 ~9 x6 C' [- W# t, v& q; \
Ethos-N77实际上就是Arm去年公布的Project Trillium项目中的那款机器学习处理器IP,其内部集成了可配置的1-4MB的SRAM,在1GHz主频下,7nm工艺下,可以提供最高4 TOPS的AI算力,每瓦性能高达5 TOP。另外,之前Project Trillium项目公布的数据显示,Ethos-N77的单位面积算力为4.6 TOPs/mm²(最新发布的可能有进一步提升)。那么Ethos-N77的这个性能在市场上处于什么水平呢?: ]; c& g) T* ?$ v
: d! }. {8 t% h( N" E, t* @5 Z, V
根据资料显示,华为麒麟970 NPU是基于寒武纪1A IP,算力是1.92TOPS。而苹果A11的NPU算力仅为0.6 TOPS,A12的NPU性能为5TOPS。而根据此前高通骁龙855发布之时的数据显示,其整体(包括CPU+GPU+DSP等)的AI算力(超过7 TOPS)是华为麒麟980的两倍,照此估算的话,麒麟980的NPU性能大概在3.5 TOPS左右。另外据芯智讯了解,华为麒麟980的NPU是基于寒武纪IH8,是针对低功耗场景视觉领域的NPU内核IP,而寒武纪IH8有 4 种可选的配置1T、2T、4T、8T OPS@1GHz,麒麟980应该是4TOPS的版本。而麒麟990系列的NPU并未公布具体的OPS数据,不过其采用了全新的达芬奇架构以及两个大核+一个小核的配置,性能应该更强。. d, F y& {" ~* V0 E/ b
3 C) R$ H3 d' @
' i, N. l) \# w- D' U4 ?
6 `9 I+ D! K) F* D+ r7 N在单位面积的算力方面,根据芯智讯此前的估算,麒麟970的NPU的单位面积性能大概是1.48 TOPs/mm²,而麒麟980和990没有相应数据可以参考。而根据TechInsights的拆解,苹果A12的NPU内核的面积为5.79mm²,也就是说苹果A12的NPU的单位面积算力约为0.86TOPS/mm²。+ C2 K4 w9 a: t8 N7 s: r
C, y9 e* b$ F. V( S; V
- ?/ h' T6 ?& P1 y$ h$ D( D, U在每瓦算力方面,华为公布的资料显示,麒麟810的每瓦算力可以达到6TOPS。苹果的NPU未有相应数据。寒武纪新的NPU内核1M在7nm下每瓦性能为5TOPS。' ]( |8 l! T0 o0 N
8 o4 a3 e; k( u& _( L. `3 X% t- l: b9 M. ]: D8 t: k3 p4 d: J( R
从上面的数据对比来看,Ethos-N77的AI性能与苹果A12和麒麟980的NPU相当,相比麒麟990系列的NPU性能可能要弱一些。在单位面积算力方面,远高于苹果A12和麒麟970的NPU。在每瓦算力方面,也是远高于苹果A12的NPU,略低于麒麟810。综合来看,Arm Ethos-N77各方面都还是比较出色的,达到了目前旗舰级NPU的水准。
0 T: D- K. {: }8 l
- b- Q3 H; i+ L6 O6 j# x
+ K8 C( H! q7 F: O5 l; z+ l需要指出的是,4 TOPS的性能是单个Ethos-N77核心在1GHz主频下的性能,如果配置双核的话,那么性能无疑将进一步提升,当然功耗和面积会进一步提升。
; y0 w& ^ s& x/ S- u
( ]5 e! B3 N) b/ W/ D) T% k$ X+ i0 y
- `7 W+ Q! {5 s7 CArm此前就表示,Ethos系列IP是具有高可扩展性、兼容性和可编程的,可以提供计算性能最低从2 GOPS到超过70 TOPS的产品。+ O" b# v, N# @5 i! k
7 C' w/ _5 W o/ j3 |2 I+ i9 f% E) T1 Q# X- b' w
另外,Arm还推出了针对主流市场的Ethos-N57,内置了512KB SRAM,在1GHz主频下,算力最高可达2TOPS;而针对低端市场的Ethos-N37,是为了提供面积最小的ML推论处理器(小于1mm²)而设计,其同样也内置了512KB SRAM,在1GHz主频下,算力可达1TOPS。: a% a& _4 A8 o3 L
: M3 e9 u3 k# g7 r# l0 P
7 v! v2 d |% x* O$ `* ^2 X, m4 Y, K% p
Arm表示,Ethos-N57和Ethos-N37针对Int8与Int16数据类型的支持性进行了优化,通过如创新的Winograd技术的落地,使性能比同类NPU提升超过200%,并且配备了先进的数据管理技术,以减少数据的移动与相关的耗电,在ML在性能与成本、面积、带宽与电池寿命之间达成了比较好的平衡。) C r7 [8 v" b" A8 u" t
& C& e' N3 m, ~
3 F& ]- V' F( a7 Z5 P4 F* I据芯智讯了解,除了移动市场之外,Arm的Ethos系列IP未来也将会开始进入物联网、工业、汽车、网络以及服务器市场。
7 C, U& w0 A! ^( O9 e# [ j% L/ ?) [9 c8 |$ u9 I% t9 s7 ~& r2 C" W
- A% r+ m8 X: Z' j2 v开源的AI开发框架Arm NN, M" {/ [" @. w# f
' A1 n( ^ c& ^% g' E& e% M
4 t. l# H6 R( A X: u) R3 N4 `$ a
我们都知道,此前高通骁龙845/855系列都并未内置专门的NPU内核,但是其仍然提供了较高的AI能力,而这一切得益于其神经网络引擎Neural Processing Engine的助力。即采用更为弹性的异构的机器学习架构,在通用平台内做内核优化,使得AI计算合理的分布在CPU、GPU、DSP等每个单元上,从而可以针对不同移动终端提供弹性调用各个处理单元来进行AI计算。
# v) O. H d5 F" g+ ], r S: g/ z* l! D
5 F& q; @2 Y7 ~/ Z2 x. W
1 X3 y3 s& F$ J/ x- F8 @. f& Z而Arm此次在发布Ethos系列NPU IP的同时,也推出了开源AI开发框架Arm NN,强化异构的AI计算,进一步提升整体的AI性能。$ B2 t7 _: n9 f1 p
2 Z, V& |7 R$ ^8 x* p
* t3 G; w% C7 ~4 W! I - D9 G. M4 n0 |7 B% f3 X
, k& O! T" E3 C5 R
1 R, f% Y" j& E" N据介绍,Arm NN是属于偏底层的架构,而且在其基础之上,可以支持其他的更高层级第三方的NN框架,并提供完整工具链,可实现在AI计算上对于Arm CPU/GPU/NPU内核的合理调用,实现更高效的异构的AI计算。, Z# r+ H5 f! ^* C+ q
1 d; ^5 [/ X* ?. A( g6 ]3 I
6 |) K0 q O- E
Arm表示,由于不同的SoC对于AI的加速方法是不一样的,因此第三方应用及开发者要用到片上系统的加速能力是比较困难的。而开源的Arm NN的推出,将降低开发者调用Arm内核的难度,进一步提升开发人员的体验。. }& V( R0 C4 F) q! w5 y0 k
7 r8 j0 X6 H, [$ L
6 R6 R$ r! Y$ I. l% L8 k p1 b
& N; N& x$ B5 `4 Q; [/ f8 o4 m. D2 ^ l5 y* \$ ]3 y- ~+ O1 _
! e) k, S% V7 J# [+ O
此外,为了推进基于Arm NN的内容创建和开发,Arm还与Unity(Unity最目前主要的3D引擎,50%的3D游戏,75%的VR内容都是基于Unity引擎开发)达成合作,进一步优化Unity引擎,使得基于Unity的开发者能够更容易的访问和更高效的利用Arm的内核,在Arm CPU/GPU/NPU之间获得更好的性能。可以实现一次开发,即可获得Arm全系列的内核的支持(即可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。
+ |& |/ Z0 W4 j! g: C
- H/ o1 N6 p$ a; S: X3 ?, d; K7 q( Y
Mali G57 GPU:为主流市场带来智能与沉浸式体验* R$ K0 _$ d. k* |' E' p- u1 r% d& }0 j
( g, Z+ s1 \# D% a+ |
! S- K% U( `* X/ F w8 h4 a今年6月,Arm针对高端市场推出了首款基于全新Valhall架构的GPU——Mali-G77。今天,Arm针对游戏市场推出了第二款基于Valhall架构的高性能、高能效的GPU内核——Mali-G57。(Vahall架构进一步提升了并行执行的能力,同时在代码上也做了尽量的简化,从编译角度来讲也更加友好。)& k1 C4 M3 w* F) V% |* a& q3 ]
0 y! K& W! t8 M+ D6 y7 W6 ^" ^) e; i5 d: K) g9 k

- r0 q1 o# ~- L; @: |* ?. B( K) b" Z# M4 o* a( K; [- o$ f
# Y6 u+ S' V$ w5 l. J# b! H据介绍,Mali-G57的性能相比上一代的Mali-G52在能效上提升了30%,性能密度提升了30%,机器学习性能提升了60%。并且Mali-G57还加入了针对虚拟现实(VR)提供注视点渲染支持,再加上机器学习性能的提升,可以支持更复杂的XR实境应用。而且,Mali-G57还支持1-6个核心的配置,可以满足不同市场定位的智能手机的需求。
# ]8 F5 y8 i7 K" {1 M5 v* z3 R' T$ j, B; c2 h* i* E* ]
0 b2 o) H5 C9 a
Arm表示,Mali-G57可以将优质的智能与沉浸式体验带到主流市场,包括高保真游戏、媲美电玩主机的移动设备图型效果、DTV的4K/8K用户接口,以及更为复杂的虚拟现实和增强现实的负荷。
" B9 [* a% o& r& y4 G; z2 ?( J1 \. I5 H& p' s7 Z
0 c0 m+ L% m+ n& z9 Y5 k2 @2 S
Mali-D37:Arm单位面积效率最高的DPU1 t" S0 Y8 ~/ _
. i, y a% x8 W+ `8 i7 f" Q+ U, B/ d; m: \/ n8 s
在今天的技术论坛上,Arm还推出了目前单位面积最高效的显示处理器Mali-D37。
/ @3 Y1 U1 |8 t9 q* W' Y- k( K4 O! q3 N, X/ B/ I2 c$ J
, Y7 J2 [! C/ Z& ]

) T( N0 u. w$ c) _6 v+ K6 s$ f$ l5 D K r4 [3 F0 Y2 D
2 t; p. u* d+ l# m; I# d9 R据介绍,Mali-D37是Arm第一个面向主流市场的基于Komeda架构DPU,拥有极高的单位面积效率,在支持全高清(Full HD)与2K分辨率的组态下,16nm制程的面积将小于1mm²。
j3 X2 f# I$ e+ j) E0 j
4 l6 i4 l& o: f: X4 k T" {* e' Y! l3 e" o7 s
在性能方面,Mali-D37保留了高阶的Mali-D71关键的显示功能,包括与Assertive Display 5结合使用后,可混合显示高动态对比(HDR)与标准动态对比(SDR)的合成内容。另外,Mali-D37其通过将部分GPU核心显示的工作负载卸载到Mali-D37来工作,以减少GPU的工作以及对于内存的访问,使得系统的功耗可以降低30%。 ]8 Y. \. M5 h5 o
& V4 L9 g8 J: t, N2 Y: ?- a5 z; A- L
Arm表示,Mali-D37可以支持入门级智能手机、平板电脑等成本较低的设备,获得2K级别的视觉效果与性能支持。% ~2 B. ?0 }0 V4 ~* L9 N
" A) ]! y6 _; P& _' E
" U% s0 @. `6 J8 l0 n! y% n7 F
Arm的通用型NPU能否获得成功?
3 I/ |3 Z8 d6 n1 ?9 j: q4 @9 a& D) k9 j5 w) c: L- r% A s/ i5 s' l( X
6 D8 g. W+ }: Q4 V7 p
从目前的市场趋势来看,AI芯片正越来越向专用化的方向发展,越来越多的算法厂商也都纷纷基于自身的算法推出了自己的AI芯片。同样,正如前面我们所提到的,目前华为、苹果、高通、三星、展锐等众多的手机芯片厂商也都有推出自己的NPU内核。那么Arm的“通用型”的Ethos NPU IP真的有市场吗?
7 c" E" s& Z+ Q
! v: N% }! c% V, Y' R
: o) r+ L* p; e5 Y3 B: k对此,Arm市场营销副总裁Ian Smythe表示,Arm的Ethos NPU IP并不是孤立存在的,其主要的优势在于,在其本身提供出色的AI性能的同时,可以更好与Arm的CPU、GPU进行协同,以实现异构的AI计算,从而进一步提升整个系统层级的AI性能、降低功耗。而且,目前AI市场还是在初期,很多的AI算法仍在快速迭代,选择“通用型”的NPU是比较安全的做法。
! u( V) @" s4 ?! F
8 f. z7 Q% a. f0 H- b& O; Y/ N0 r! l+ S6 E( C1 n+ y8 A+ ]
' @* j- P+ N9 t$ ~5 C. Z) f5 K2 L. @
) ?6 N, u! J% |7 D在采访当中,Ian Smythe向芯智讯确认,Arm的Ethos NPU IP也可被集成于比如RISC-V等其他架构的SoC当中,但是Ian Smythe也强调,这样并不能发挥出Ethos NPU与其它非Arm CPU/GPU在AI计算上的协同优势。5 K% c" {8 b; F6 L
7 I7 x# G$ I1 a9 E4 s) m# U$ N* Y7 N- e- @8 L$ Y( G* a7 W: D
另外,Arm的Ethos NPU IP还实现了对于高中低阶的全面覆盖,但是目前众多的芯片厂商主要还是在其高端SoC当中集成了NPU,而随着AI计算向边缘侧部署的趋势,未来市场对于NPU的需求也将会越来越大。Ethos NPU IP的推出,将可帮助芯片设计厂商更简单、更低成本的获得不同档位的NPU内核的支持。
" p) P; F# ]) \, K' T/ K6 R8 `- {+ `6 @6 D; s# ~9 b
" a) R5 f3 ~- D0 H# q
另一方面,目前的Android应用生态基本都是基于Arm架构的处理器,因此,如果采用Arm的Ethos NPU IP,结合开源的Arm NN框架,应用开发者将可以更简单、高效的调用Arm的CPU/GPU/NPU内核,可以为用户带来更为出色的AI体验。而且,可以实现一次开发,即可获得Arm全系列的内核的支持(这也意味着,可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。而对于其他的芯片厂商的NPU来说,开发者要想实现灵活高效的调用NPU,充分发挥其AI性能,则需要针对性的进行优化,而且还需要其提供相应的权限和工具。即便是开发者开发应用实现对于A厂商的NPU调用,同样的应用要想实现对于B厂商NPU的调用,可能需要重新进行编译。显然,对于应用开发者来说,Arm的NPU所具备的生态优势无疑是其他厂商所无法比拟的。
. J2 h! C d! g; {# O' |) M- w4 Y R$ _6 |8 z- e7 ^! w
( X# e: e a# s# G最后,Ian Smythe强调,Arm对于AI性能的提升是多维度的,一方面会持续推出更高性能的NPU IP,同时也在不断提升Arm CPU/GPU的AI性能。5 ^ H' g# J' w6 Q4 t* g$ u
1 j1 r5 c C! e e
~% }) n3 y1 l" u/ p
' L* Y7 Z% [ W) d( J6 e
1 |3 \ w! ]5 P3 v, f# X! i2 N1 `8 m* y# y0 M. d9 O
值得一提的是,Ian Smythe在演讲当中透露,Arm在下下一代的大核架构Matterhorn当中,加入Matrix Multiple(MatMul),令其ML(机器学习)性能与前代CPU相比提升一倍。
" r' o! V( V& f4 T5 K- B$ N( R. u
5 Z( O- G0 |. \+ D
编辑:芯智讯-浪客剑3 y. f) |/ v1 ^8 P% q; y R, U
往期精彩文章0 {( O# u, v/ S! F$ _, e! [$ z+ J' f
VR市场迎来第二春:5G+VR云化将成最大推力!! `- k' J4 X) a2 s. V2 v
/ Q2 [2 g& a) E/ e% C& U6 T
2019生物识别论坛成功落幕:这十大看点不容错过!# C" X$ |0 ^9 P/ E- e' \7 |
阿里平头哥正式开源RISC-V架构MCU芯片平台 A6 N* b3 _; o/ y
首度杀入3D人脸识别门锁/门禁市场,英特尔为何选择与小钴科技结盟?
: Y5 \$ k" t" b5 }/ H& s6 o" ^ f* U
展锐再推4G功能机芯片虎贲T117,意义何在?! F2 o* B- l0 j- r/ D9 V
5 N0 e: {6 O6 d1 Y% z7 y历史首次!华为海思4G芯片Balong 711对外销售!
4 h9 G& L+ e% R, k$ J2 }& m, u, w1 S6 Q- f e: K
不惧美国打压!华为已获得65份5G商用合同,5G基站发货超40万个!7 y% f; O3 S, |# K- f7 u
! C1 H6 R0 ^$ C' C5 V" {' l
巨额债务违约+资金链断裂?手机ODM厂商海派关厂裁员!5 u A0 Z a9 [1 u
1 _: w; v8 ]. _( w4 A# Q1 d
可穿戴巨头Fitbit宣布撤出中国!4 }+ c1 y& U4 n5 |+ o I' H
* F1 k; ]! C" Z! p! j收购Intel基带芯片业务涉嫌违规?苹果遭市监总局启动问询
& e1 F! N6 A& [: f9 ^( e: C% o
2 c: Z8 ^( j6 b4 w0 K0 _) h禁令之下,安防巨头海康与大华的应对之策!
8 a) t- E! \- ~( E
, z8 {) U% \7 T+ Z; a. \为应对RISC-V挑战?Arm CPU引入自定义指令功能!
4 }2 u% G) j2 r行业交流、合作请加微信:icsmart01/ {* u9 u+ L1 m( v4 N
芯智讯官方交流群:221807116
% ` ^ _5 ]( F/ z+ v; ?- D
) W2 v' [, D5 i! a( _3 U来源:http://mp.weixin.qq.com/s?src=11×tamp=1572103805&ver=1936&signature=jeCKwe1UBQzC*Pzs8GoY9TZBvEs1rdMAvR4c22h3Cpdg-qQ*TOrpE2uZ4YvRMx7pQMFu5Q-as9lkvJgPIZqWm1WA-*ncmgAC2Ls6p79VafFsjOW9cM78m6hG7c-lzR2Q&new=1
- z9 o3 w: m: r. p# h& s2 y免责声明:如果侵犯了您的权益,请联系站长,我们会及时删除侵权内容,谢谢合作! |
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有账号?立即注册
×
|