|
|

7 j6 w$ p4 Z8 e- m( ^4 [- S/ n; _. G' l: C T1 C5 `
8 m/ y9 ]( G8 D
10月23日,在北京召开的2019 Arm技术峰会上,Arm正式发布了全新的Ethos-N77/N57/N37系列NPU IP,进一步加码人工智能(AI)计算。与此同时,Arm还推出了针对主流移动游戏市场的高能效的Mali G57 GPU和针对主流及入门级市场的单位面积最高效的Mali-D37 DPU。
0 D" m0 W& u0 I7 `% }; X8 B" a4 U5 {7 I( ]) a4 z
: [0 [3 x7 g6 \7 QARMv8及后续架构将不受限制的继续支持中国合作伙伴!
2 G/ R0 Y+ [+ D" T% N, p9 w! i) X" Q2 F' }- |9 k5 U
7 |7 s- q: M" R# m
今年9月25日,Arm中国在深圳召开媒体沟通会,针对此前外界盛传的“Arm断供华为”一事,Arm表示与华为仍是合作伙伴,ARMv8及后续V9指令集可继续授权!9 B: [# b/ b! M. ~) \
4 x Z9 l, n: `; n; t6 u; G2 S
% Q6 T ?* p \$ `+ @, m' F% ]10月23日,在2019 Arm技术峰会北京站上,Arm董事长兼CEO吴雄昂在开场致辞当中再度重申,经过法务严谨的调查及相关调整,目前无论是ARMv8,还是后续的V9架构都是源自英国的技术,将可不受限制的继续支持中国的合作伙伴!; g( S2 I. z4 n
2 D7 n& A1 @+ X; a1 w$ _8 \/ N9 M' m8 F0 V6 R+ w

$ {% q: ^* [) t4 v* w5 a
- S$ Q; Y* M; e, N! A8 O4 o: o+ p: r" e7 H5 B" v+ Q. q) c8 u
此外,吴雄昂还指出,Arm在中国的合作伙伴已经超过200家,中国合作伙伴出货的基于Arm架构的芯片已超过了160亿颗,国产SoC芯片95%都是基于Arm架构的。# Q C' k8 s3 J; d7 r
2 |8 U7 A, c) U, ? [8 Y4 E# o
0 H" M+ x* z3 f* g* K+ k& ?吴雄昂强调,Arm是唯一非源于美国的主流计算架构。Arm中国承接Arm在中国的业务和技术,在Arm标准之下自主创新、赋能产能,把中国工程师能力调动起来打造知识产权。这些知识产权将不只是提供给中国产业,还要通过统一标准面向全球。
" g+ \# ]0 l6 t8 @ Q7 ] a( `! ~3 h) W2 O
9 H0 e! m8 I$ G) C4 R! b% m+ U
加码AI计算,Arm发布Ethos系列NPU IP
! n* A) N! Y' S3 F: ], A5 y. s' ]. t6 [
/ j" ?2 g$ F; x( V' p" U根据Arm及研究机构的预计,到 2028 年,移动设备的数量将从现在的17亿台增长到 22 亿台,智能的IP Camera将由现在的1.6亿台增长到13亿台。在终端侧具有人工智能的设备将会由现在的3亿台增长到32亿台。足见人工智能市场增长之迅速。: E. |! `" J( e& l
9 T7 J- a( ?8 S6 y5 o* ^4 `+ z
( }0 c5 B# Y6 x
而随着AI技术的兴起和广泛应用,AI对于芯片的算力也提出了更高的要求。作为全球最大的处理器IP供应商,Arm的Cortex CPU和Mali GPU在以智能手机为代表的移动终端市场占据了极大的市场份额,但是在AI计算领域,Arm此前一直都是依托于其Cortex CPU、Mali GPU及相关软件开发工具来提升其AI计算的能力。3 _5 Q. W* U2 \9 S" }" |* T& }) I5 K
- U$ q# u6 H8 p! T2 s ^, U
2 o9 q/ w# o" C0 F/ K
但是,传统的CPU、GPU核心并不是AI计算的最佳载体。因此越来越多的芯片厂商开始推出了AI专用芯片,或者在SoC当中加入AI计算专用的NPU内核。比如华为2017年就率先推出了集成NPU内核的麒麟970处理器,同时苹果推出的A11处理器也首次集成了NPU内核。此后,高通、联发科、三星、展锐等手机芯片厂商也纷纷开始在SoC当中集成自己的NPU内核。3 _2 C% Y( b+ L' G- S* D
4 ]9 {, ]: L% _9 \) `$ H/ L' ~, s6 A' s" S+ f: a6 Z' K ]
在此趋势之下,为了应对市场对于AI内核的需求,Arm在2018年年初也公布了针对AI的Project Trillium项目,其中就包括了全新的机器学习处理器IP、目标检测处理器IP和神经网络软件库。经过了近两年的时间,现在Project Trillium项目的成果也开始正式产品化。
" F: r6 h" U9 @2 b! a* d1 a
. }' w0 b9 k3 ~3 m8 o* m% l8 @4 i7 [3 M3 u
, ?. e$ r7 p. x% y, I. n3 l
. b' a! Z" o0 [0 d6 t
, ~/ q+ s# w, h! {& m, m3 \* k7 P8 h# D0 G
5 J. {* o" x+ H. Z% [; {; G
今天,Arm市场营销副总裁Ian Smythe 在Arm技术峰会上正式发布了全新的Ethos系列NPU IP,包括针对高端市场的Ethos-N77、针对主流市场的Ethos-N57和低端市场的Ethos-N37。
( l# ?8 B: n* T
e& k @, O9 K# ^7 \6 l' @
' l. F. p/ V0 e* C) i
$ Z; U3 U+ H0 b M( h
1 l2 Z! b# V& f' S/ |, p/ g- Z' ]+ V# f1 s0 s+ Y
3 z( A5 K f3 j E0 N/ L: s
Ethos-N77实际上就是Arm去年公布的Project Trillium项目中的那款机器学习处理器IP,其内部集成了可配置的1-4MB的SRAM,在1GHz主频下,7nm工艺下,可以提供最高4 TOPS的AI算力,每瓦性能高达5 TOP。另外,之前Project Trillium项目公布的数据显示,Ethos-N77的单位面积算力为4.6 TOPs/mm²(最新发布的可能有进一步提升)。那么Ethos-N77的这个性能在市场上处于什么水平呢?
: T1 I p& _8 Y! h4 X $ }+ H" r# t I& a
根据资料显示,华为麒麟970 NPU是基于寒武纪1A IP,算力是1.92TOPS。而苹果A11的NPU算力仅为0.6 TOPS,A12的NPU性能为5TOPS。而根据此前高通骁龙855发布之时的数据显示,其整体(包括CPU+GPU+DSP等)的AI算力(超过7 TOPS)是华为麒麟980的两倍,照此估算的话,麒麟980的NPU性能大概在3.5 TOPS左右。另外据芯智讯了解,华为麒麟980的NPU是基于寒武纪IH8,是针对低功耗场景视觉领域的NPU内核IP,而寒武纪IH8有 4 种可选的配置1T、2T、4T、8T OPS@1GHz,麒麟980应该是4TOPS的版本。而麒麟990系列的NPU并未公布具体的OPS数据,不过其采用了全新的达芬奇架构以及两个大核+一个小核的配置,性能应该更强。
$ l& x/ j9 K7 E8 U6 b ?3 n1 c7 {4 A0 R, m" u% V' R# Y
, Z+ ^3 E7 j: n* Y- s8 W+ ^" k4 \$ N/ f6 ]6 L4 g0 Q
在单位面积的算力方面,根据芯智讯此前的估算,麒麟970的NPU的单位面积性能大概是1.48 TOPs/mm²,而麒麟980和990没有相应数据可以参考。而根据TechInsights的拆解,苹果A12的NPU内核的面积为5.79mm²,也就是说苹果A12的NPU的单位面积算力约为0.86TOPS/mm²。
' ~% |7 M; E$ \/ z, U: s1 r% ]/ F( u7 ^' M. l( k
: y/ X: e# O q8 T) ?2 E在每瓦算力方面,华为公布的资料显示,麒麟810的每瓦算力可以达到6TOPS。苹果的NPU未有相应数据。寒武纪新的NPU内核1M在7nm下每瓦性能为5TOPS。3 b& ]5 Q2 d H( `) z+ \- d* q
( H0 [) E7 p' C _+ {
4 e/ ?6 p* S, W% Q( X n从上面的数据对比来看,Ethos-N77的AI性能与苹果A12和麒麟980的NPU相当,相比麒麟990系列的NPU性能可能要弱一些。在单位面积算力方面,远高于苹果A12和麒麟970的NPU。在每瓦算力方面,也是远高于苹果A12的NPU,略低于麒麟810。综合来看,Arm Ethos-N77各方面都还是比较出色的,达到了目前旗舰级NPU的水准。
* o! ~( e5 g3 E& A2 R K3 ~9 @6 r. g5 ^# J/ Y4 u S$ n
$ G% }1 J* j+ G0 i& X0 `7 K+ n9 n
需要指出的是,4 TOPS的性能是单个Ethos-N77核心在1GHz主频下的性能,如果配置双核的话,那么性能无疑将进一步提升,当然功耗和面积会进一步提升。
' ?" @3 e. ` D4 K" s s. q2 N
' j: D- p, N8 ?4 [
1 X7 T( H4 I& k8 w- n: [Arm此前就表示,Ethos系列IP是具有高可扩展性、兼容性和可编程的,可以提供计算性能最低从2 GOPS到超过70 TOPS的产品。* f% P6 t( |9 n) O2 q7 a( @
( a+ S* q G: p) o
. K, u- x$ a+ N5 R另外,Arm还推出了针对主流市场的Ethos-N57,内置了512KB SRAM,在1GHz主频下,算力最高可达2TOPS;而针对低端市场的Ethos-N37,是为了提供面积最小的ML推论处理器(小于1mm²)而设计,其同样也内置了512KB SRAM,在1GHz主频下,算力可达1TOPS。7 G; e, G- o- x+ P {9 R2 {' ~
: w& ]* A a7 l& |$ b3 Q! s2 T$ r; s4 F2 U$ T6 w
Arm表示,Ethos-N57和Ethos-N37针对Int8与Int16数据类型的支持性进行了优化,通过如创新的Winograd技术的落地,使性能比同类NPU提升超过200%,并且配备了先进的数据管理技术,以减少数据的移动与相关的耗电,在ML在性能与成本、面积、带宽与电池寿命之间达成了比较好的平衡。
5 X% n* Z4 d4 f" s4 C4 w& U# k& k+ w- t$ k& P3 \( ]
d, p; `$ A1 o' _! v1 w9 d
据芯智讯了解,除了移动市场之外,Arm的Ethos系列IP未来也将会开始进入物联网、工业、汽车、网络以及服务器市场。
7 y4 {# O$ V1 H' T {$ k; I( [7 d) {3 L: K
/ Q& T: Y! X+ y6 }. c# q, @7 v, R
开源的AI开发框架Arm NN6 f$ n/ N( J* b9 g
+ Q) U* ]8 k( ~; g3 [4 ?+ G7 K! I: t6 {
我们都知道,此前高通骁龙845/855系列都并未内置专门的NPU内核,但是其仍然提供了较高的AI能力,而这一切得益于其神经网络引擎Neural Processing Engine的助力。即采用更为弹性的异构的机器学习架构,在通用平台内做内核优化,使得AI计算合理的分布在CPU、GPU、DSP等每个单元上,从而可以针对不同移动终端提供弹性调用各个处理单元来进行AI计算。 S6 |% {( @0 H0 _, ~
6 N- P; w( @6 q$ Q
: @% z& X2 f: w1 A# @1 n$ Z+ q; B1 j/ f而Arm此次在发布Ethos系列NPU IP的同时,也推出了开源AI开发框架Arm NN,强化异构的AI计算,进一步提升整体的AI性能。, e8 k6 x8 s6 B/ }. N/ K* S
- K: S2 g' r6 _4 r# i2 @
6 c! U4 D: l+ e- @, d# u 2 |) b0 S/ U2 b1 S
1 n6 c; O" L3 b0 r- r
. @' B( }+ [, B* E% W- Y. b: z
据介绍,Arm NN是属于偏底层的架构,而且在其基础之上,可以支持其他的更高层级第三方的NN框架,并提供完整工具链,可实现在AI计算上对于Arm CPU/GPU/NPU内核的合理调用,实现更高效的异构的AI计算。; x1 m4 \0 `6 b
3 _! W3 L7 j6 n
3 f9 ?9 @3 s @' @
Arm表示,由于不同的SoC对于AI的加速方法是不一样的,因此第三方应用及开发者要用到片上系统的加速能力是比较困难的。而开源的Arm NN的推出,将降低开发者调用Arm内核的难度,进一步提升开发人员的体验。6 L2 T( v& b' ?9 j/ f7 i
! x. Q/ _: V* @+ T
6 \% `+ R5 R7 _" T/ T
6 f" \. k5 Y$ k9 V. `, M: k
! a3 B. o, U# J+ ]( b3 w% e; U7 R
此外,为了推进基于Arm NN的内容创建和开发,Arm还与Unity(Unity最目前主要的3D引擎,50%的3D游戏,75%的VR内容都是基于Unity引擎开发)达成合作,进一步优化Unity引擎,使得基于Unity的开发者能够更容易的访问和更高效的利用Arm的内核,在Arm CPU/GPU/NPU之间获得更好的性能。可以实现一次开发,即可获得Arm全系列的内核的支持(即可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。* k: t" ^( H" t* ~7 u% H+ T! _
8 y2 t" R; h* ^8 Q9 ^2 a
$ }: J; V W4 QMali G57 GPU:为主流市场带来智能与沉浸式体验
2 }6 z5 b4 }; [% [ h [; q7 Z- J
+ J( @8 K4 g, P* d, u4 F& n今年6月,Arm针对高端市场推出了首款基于全新Valhall架构的GPU——Mali-G77。今天,Arm针对游戏市场推出了第二款基于Valhall架构的高性能、高能效的GPU内核——Mali-G57。(Vahall架构进一步提升了并行执行的能力,同时在代码上也做了尽量的简化,从编译角度来讲也更加友好。)1 U8 N7 F8 z6 p$ _& c
0 o& \( o" r7 ?! c( T3 R
$ O/ L5 Z( x7 A9 E) R- s: v/ G

# k, W Y4 x6 e7 ~/ M( B D6 ~- d" `5 B
- \9 r ~+ U% ]- B
据介绍,Mali-G57的性能相比上一代的Mali-G52在能效上提升了30%,性能密度提升了30%,机器学习性能提升了60%。并且Mali-G57还加入了针对虚拟现实(VR)提供注视点渲染支持,再加上机器学习性能的提升,可以支持更复杂的XR实境应用。而且,Mali-G57还支持1-6个核心的配置,可以满足不同市场定位的智能手机的需求。
1 {: m9 U& A" i2 r9 v8 R4 a+ R/ X$ A6 V( a# j: B
9 B0 q2 J1 `, V: d
Arm表示,Mali-G57可以将优质的智能与沉浸式体验带到主流市场,包括高保真游戏、媲美电玩主机的移动设备图型效果、DTV的4K/8K用户接口,以及更为复杂的虚拟现实和增强现实的负荷。
/ k! T& e' _1 F8 E9 a* M: {7 ~$ e# \- m" q3 ?( X' a5 ~* |
$ M& R, ?+ o1 Q5 n5 J2 _8 EMali-D37:Arm单位面积效率最高的DPU
. A% s4 g0 f r4 Z$ j" f! h; c8 {; s( H9 o$ q. w; O
; j4 B( I0 i. j3 ?4 M) ~8 a- H& |+ k
在今天的技术论坛上,Arm还推出了目前单位面积最高效的显示处理器Mali-D37。- _! t) u% x4 E
4 T. r* @$ z- q# ?; b5 I, ^2 R) U s3 m e9 f: t

* z$ }6 R/ X9 O( t: z" G/ @9 g0 [: ]) o1 a
9 S' b* p7 X& h9 M7 I据介绍,Mali-D37是Arm第一个面向主流市场的基于Komeda架构DPU,拥有极高的单位面积效率,在支持全高清(Full HD)与2K分辨率的组态下,16nm制程的面积将小于1mm²。
3 ]5 l3 d' I' q$ ^
0 P" p d7 c' s) J* g# S% H( V+ y, S" E* Y
在性能方面,Mali-D37保留了高阶的Mali-D71关键的显示功能,包括与Assertive Display 5结合使用后,可混合显示高动态对比(HDR)与标准动态对比(SDR)的合成内容。另外,Mali-D37其通过将部分GPU核心显示的工作负载卸载到Mali-D37来工作,以减少GPU的工作以及对于内存的访问,使得系统的功耗可以降低30%。
3 Y6 m7 y8 U( n4 o5 c) i/ J
V$ e8 Z U. r8 Y: }3 S1 [' h3 o- _ w' i% y: {4 x
Arm表示,Mali-D37可以支持入门级智能手机、平板电脑等成本较低的设备,获得2K级别的视觉效果与性能支持。6 I J3 l# s; m$ H1 q
3 g" C5 X( n! H6 F+ ^6 o2 y& w7 M, ]. M8 I
Arm的通用型NPU能否获得成功?9 W# {" t& B1 y- ? ~3 [6 A0 u
% _% r) P$ A y2 ?! u+ Q- g& r/ Q" n# k# ]5 [ I) o" r
从目前的市场趋势来看,AI芯片正越来越向专用化的方向发展,越来越多的算法厂商也都纷纷基于自身的算法推出了自己的AI芯片。同样,正如前面我们所提到的,目前华为、苹果、高通、三星、展锐等众多的手机芯片厂商也都有推出自己的NPU内核。那么Arm的“通用型”的Ethos NPU IP真的有市场吗?
8 {4 Q6 ?0 g0 ^2 h! |- X: I- P; ] y/ o
6 ~9 S& F" J" D8 w' E0 v2 Z$ t
对此,Arm市场营销副总裁Ian Smythe表示,Arm的Ethos NPU IP并不是孤立存在的,其主要的优势在于,在其本身提供出色的AI性能的同时,可以更好与Arm的CPU、GPU进行协同,以实现异构的AI计算,从而进一步提升整个系统层级的AI性能、降低功耗。而且,目前AI市场还是在初期,很多的AI算法仍在快速迭代,选择“通用型”的NPU是比较安全的做法。
f6 ]3 ^" F4 ^" i
, }7 s5 y0 q- l* M: Z
! B. B) u6 t" J) }1 N" O1 Z. ^& v& \
+ [- [$ Y! o D# [/ d
, N7 G" z+ Q. n9 d! z+ }* c1 u/ M
在采访当中,Ian Smythe向芯智讯确认,Arm的Ethos NPU IP也可被集成于比如RISC-V等其他架构的SoC当中,但是Ian Smythe也强调,这样并不能发挥出Ethos NPU与其它非Arm CPU/GPU在AI计算上的协同优势。
, [, Y6 h) f( {- H3 [" g" p
1 S5 V) E& f+ J+ e) k. X$ u2 x. |; i& q/ v7 y
另外,Arm的Ethos NPU IP还实现了对于高中低阶的全面覆盖,但是目前众多的芯片厂商主要还是在其高端SoC当中集成了NPU,而随着AI计算向边缘侧部署的趋势,未来市场对于NPU的需求也将会越来越大。Ethos NPU IP的推出,将可帮助芯片设计厂商更简单、更低成本的获得不同档位的NPU内核的支持。9 t j+ P: E: l3 l; b
- z# Z6 E* E% ?7 z5 j- C- r
% u+ v+ t1 i, n另一方面,目前的Android应用生态基本都是基于Arm架构的处理器,因此,如果采用Arm的Ethos NPU IP,结合开源的Arm NN框架,应用开发者将可以更简单、高效的调用Arm的CPU/GPU/NPU内核,可以为用户带来更为出色的AI体验。而且,可以实现一次开发,即可获得Arm全系列的内核的支持(这也意味着,可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。而对于其他的芯片厂商的NPU来说,开发者要想实现灵活高效的调用NPU,充分发挥其AI性能,则需要针对性的进行优化,而且还需要其提供相应的权限和工具。即便是开发者开发应用实现对于A厂商的NPU调用,同样的应用要想实现对于B厂商NPU的调用,可能需要重新进行编译。显然,对于应用开发者来说,Arm的NPU所具备的生态优势无疑是其他厂商所无法比拟的。+ Q. X# U* v( G K2 s9 A
$ x4 D( U0 D# p+ U8 m: n
6 j! z; p1 \; R- E0 |0 W- H- [& t% N4 y最后,Ian Smythe强调,Arm对于AI性能的提升是多维度的,一方面会持续推出更高性能的NPU IP,同时也在不断提升Arm CPU/GPU的AI性能。
. ^/ m/ N4 ]) d2 J, E$ P# e9 _! B( q! R! i
# j ?' S R* G- L" n3 F' o
" C3 c* _' d' m/ b3 X# o/ H8 J/ A$ A$ U( u& E
: J) `5 [: `8 ~8 [, x' p
值得一提的是,Ian Smythe在演讲当中透露,Arm在下下一代的大核架构Matterhorn当中,加入Matrix Multiple(MatMul),令其ML(机器学习)性能与前代CPU相比提升一倍。
T) m& \1 T- m
8 ]/ Z( ?: h) j2 l& q/ M3 ]: Y- u+ d* g8 x' Z( ^; f
编辑:芯智讯-浪客剑. U% x; s/ u4 h! @! k: w% U2 O
往期精彩文章 u$ @ I, S. G
VR市场迎来第二春:5G+VR云化将成最大推力!* U# G. \3 o( @) u. w
# j$ g* S! h1 L- \& n) f5 o
2019生物识别论坛成功落幕:这十大看点不容错过!
) Q2 R$ X2 U0 b1 Z阿里平头哥正式开源RISC-V架构MCU芯片平台) @2 H2 O; Z/ |: ?
首度杀入3D人脸识别门锁/门禁市场,英特尔为何选择与小钴科技结盟?
6 f5 X/ Y2 l6 ?( ~9 R, Q# Y$ r w- `; u6 l/ U- L, d) v9 L+ Y
展锐再推4G功能机芯片虎贲T117,意义何在?+ s3 L6 P7 W" \1 T* e h& _
5 W* Y% ]( X. E8 e8 r2 Z( e历史首次!华为海思4G芯片Balong 711对外销售!
% y; A/ z' a5 T, c$ G+ L: |- L. h2 l4 t: h/ r# S% t
不惧美国打压!华为已获得65份5G商用合同,5G基站发货超40万个!' A( m$ O$ o4 B7 Z4 L% Q
2 e* J2 m" Z3 _( b# f8 p, E巨额债务违约+资金链断裂?手机ODM厂商海派关厂裁员!
8 h9 l! e. ]$ O8 c. b; U' R* w$ {2 T) Q) }* O8 v* X
可穿戴巨头Fitbit宣布撤出中国!
& _/ H. y/ P4 I5 a/ O6 \- S4 |+ C3 G* g( Y3 h8 M3 j
收购Intel基带芯片业务涉嫌违规?苹果遭市监总局启动问询
2 r, e( y: P: N/ x0 r1 \8 B& I3 [" O4 i$ m+ @
禁令之下,安防巨头海康与大华的应对之策!" b: [! W. G) n8 E# y
+ ~. w" \1 I) P为应对RISC-V挑战?Arm CPU引入自定义指令功能!
' w9 `, O. v$ u# m+ [- H% _) T行业交流、合作请加微信:icsmart01: Z2 x) y5 u" D8 m5 |; c) w
芯智讯官方交流群:221807116 ( @5 K5 |! G: x8 p
8 e7 F) t0 s1 P* E来源:http://mp.weixin.qq.com/s?src=11×tamp=1572103805&ver=1936&signature=jeCKwe1UBQzC*Pzs8GoY9TZBvEs1rdMAvR4c22h3Cpdg-qQ*TOrpE2uZ4YvRMx7pQMFu5Q-as9lkvJgPIZqWm1WA-*ncmgAC2Ls6p79VafFsjOW9cM78m6hG7c-lzR2Q&new=1" K) Q0 K9 i- s: Y! L0 e3 R" n# G
免责声明:如果侵犯了您的权益,请联系站长,我们会及时删除侵权内容,谢谢合作! |
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有账号?立即注册
×
|