Ampere(マイクロアーキテクチャ)

アンペア
発売2020年5月14日; 5年前 ( 2020-05-14 )
デザイン:エヌビディア
製造元
製造プロセスTSMC N7 (プロフェッショナル)
Samsung 8N (コンシューマー)
コードネームGA10x
製品シリーズ
デスクトップ
プロフェッショナル/ワークステーション
  • RTX Aシリーズ
サーバー/データセンター
  • A100
仕様
L1キャッシュ SM あたり192 KB (プロフェッショナル) SM あたり
128 KB (コンシューマー) 
L2キャッシュ2  MB~6  MB
メモリサポート
PCIeサポートPCIe 4.0
サポートされているグラフィックAPI
ダイレクトXDirectX 12 Ultimate (機能レベル 12_2)
ダイレクト3DDirect3D 12.0
シェーダーモデルシェーダーモデル 6.8
オープンGLオープンGL 4.6
CUDAコンピューティング能力 8.6
ヴルカンバルカン 1.3
サポートされているコンピューティングAPI
オープンCLOpenCL 3.0
メディアエンジン
エンコードコーデック
デコードコーデック
カラービット深度
  • 8ビット
  • 10ビット
エンコーダー対応NVENC
ディスプレイ出力
歴史
前任者チューリング (消費者向け)
ボルタ (プロフェッショナル向け)
後継Ada Lovelace (消費者)
Hopper (データセンター)
サポート状況
サポートされている

Ampereは、 VoltaアーキテクチャとTuringアーキテクチャの後継としてNVIDIAが開発したグラフィックス・プロセッシング・ユニット(GPU)マイクロアーキテクチャのコードネームです。2020年5月14日に正式に発表され、フランスの数学者・物理学者アンドレ=マリー・アンペールにちなんで名付けられました[1] [2]

Nvidiaは、2020年9月1日のGeForceスペシャルイベントで、AmpereアーキテクチャのGeForce 30シリーズのコンシューマー向けGPUを発表しました。 [3] [4] Nvidiaは、2020年11月16日のSC20でA100 80 GB GPUを発表しました。[5]モバイルRTXグラフィックスカードとAmpereアーキテクチャに基づくRTX 3060は、2021年1月12日に公開されました。[6]

NvidiaはGTC 2022でAmpereの後継となるHopperを発表し、GPU Technology Conference 2021では2024年リリースの 「Ampere Next Next」( Blackwell )を発表しました。

詳細

Ampere アーキテクチャのアーキテクチャ上の改善点は次のとおりです。

  • A100用のCUDA Compute Capability 8.0、GeForce 30シリーズ用の8.6 [7]
  • TSMCA100向け7nm FinFETプロセス
  • GeForce 30シリーズ向けのSamsung8nmプロセス(8N)のカスタムバージョン[8]
  • FP16、 bfloat16、TensorFloat-32(TF32)、FP64のサポートとスパースアクセラレーションを備えた第3世代Tensorコア。 [9]個々のTensorコアは、クロックあたり256のFP16 FMA操作を備え、以前のTensorコア世代と比較して4倍の処理能力(GA100のみ、GA10xでは2倍)を備えています。Tensorコア数はSMあたり1つに削減されています。
  • 第 2 世代のレイ トレーシング コア。GeForce 30 シリーズではレイ トレーシング、シェーディング、コンピューティングを同時に実行できます。
  • A100 40 GB および A100 80 GB の高帯域幅メモリ 2 (HBM2)
  • GeForce RTX 3090、RTX 3080 Ti、RTX 3080、RTX 3070 Ti 用GDDR6Xメモリ
  • GA10x GPU の SM あたり 2 つの FP32 コア
  • NVLink 3.0(ペアあたり50 Gbit/sのスループット)[9]
  • SR-IOVをサポートするPCI Express 4.0 (SR-IOV は A100 専用に予約されています)
  • 最大 7 つのインスタンスをサポートする A100 のマルチインスタンス GPU (MIG) 仮想化および空間 GPU パーティショニング機能
  • PureVideo機能セットKハードウェアビデオデコードとAV1ハードウェアデコード[10]を備えたGeForce 30シリーズおよびA100の機能セットJ
  • A100用5つのNVDEC
  • YUV420、YUV422、YUV444、YUV400、RGBAに対応した、ハードウェアベースの5コアJPEGデコード(NVJPG )を追加しました。Nvidia NVJPEG ( JPEGエンコード/デコード用のGPUアクセラレーションライブラリ)と混同しないでください。

チップス

  • GA100 [11]
  • GA102
  • GA103
  • GA104
  • GA106
  • GA107
  • GA10B

計算能力の比較:GP100 vs GV100 vs GA100 [12]

GPU機能エヌビディア テスラ P100エヌビディア テスラ V100エヌビディアA100
GPUコードネームGP100GV100GA100
GPUアーキテクチャパスカルボルタアンペア
コンピューティング能力6.07.08.0
糸/経糸323232
最大ワープ / SM646464
最大スレッド数 / SM204820482048
最大スレッドブロック数 / SM323232
最大32ビットレジスタ / SM655366553665536
最大レジスタ数 / ブロック655366553665536
最大レジスタ数 / スレッド255255255
最大スレッドブロックサイズ102410241024
FP32 コア / SM646464
SMレジスタとFP32コアの比率102410241024
共有メモリサイズ / SM64KB最大96KBまで設定可能最大164KBまで設定可能

精度サポートマトリックスの比較[13] [14]

サポートされているCUDAコア精度サポートされているTensor Coreの精度
FP16FP32FP64INT1INT4INT8TF32BF16FP16FP32FP64INT1INT4INT8TF32BF16
エヌビディア テスラ P4いいえはいはいいいえいいえはいいいえいいえいいえいいえいいえいいえいいえいいえいいえいいえ
エヌビディアP100はいはいはいいいえいいえいいえいいえいいえいいえいいえいいえいいえいいえいいえいいえいいえ
エヌビディア・ボルタはいはいはいいいえいいえはいいいえいいえはいいいえいいえいいえいいえいいえいいえいいえ
エヌビディア・チューリングはいはいはいいいえいいえいいえいいえいいえはいいいえいいえはいはいはいいいえいいえ
エヌビディアA100はいはいはいいいえいいえはいいいえはいはいいいえはいはいはいはいはいはい

伝説:

  • FPnn: nnビットの浮動小数点数
  • INTn: nビットの整数
  • INT1: バイナリ
  • TF32: テンソル浮動小数点数32
  • BF16: bfloat16

デコード性能の比較

同時ストリームH.264 デコード (1080p30)H.265 (HEVC) デコード (1080p30)VP9デコード(1080p30)
V100162222
A10075157108

アンペールが死ぬ

死ぬGA100 [15]GA102 [16]GA103 [17]GA104 [18]GA106 [19]GA107 [20]GA10B [21]GA10F
ダイサイズ826  mm 2628  mm 2496  mm 2392  mm 2276  mm 2200  mm 2448  mm 2?
トランジスタ542億283億22B174億12B87億21B?
トランジスタ密度65.6 MTr/mm 245.1 MTr/mm 244.4 MTr/mm 244.4 MTr/mm 243.5 MTr/mm 243.5 MTr/mm 246.9 MTr/mm 2?
グラフィックス処理クラスター87663221
ストリーミングマルチプロセッサ12884604830201612
CUDAコア819210752768061443840256020481536
テクスチャマッピングユニット512336240192120806448
レンダリング出力単位192112969648323216
テンソルコア512336240192120806448
RTコア該当なし8460483020812
L1キャッシュ24MB 10.5MB 7.5MB 6MB 3MB 2.5MB 3MB 1.5MB 
SMあたり192  KB
 SMあたり128 KBSMあたり192  KB
SMあたり128  KB
L2キャッシュ40MB 6MB 4MB 4MB 3MB 2MB 4MB 1MB 

A100 アクセラレータと DGX A100

AmpereベースのA100アクセラレータは、2020年5月14日に発表およびリリースされました。[9] A100は、19.5テラフロップスのFP32パフォーマンス、6912個のFP32/INT32 CUDAコア、3456個のFP64 CUDAコア、40GBのグラフィックスメモリ、1.6TB/sのグラフィックスメモリ帯域幅を備えています。[22] A100アクセラレータは、当初、8台のA100を含む第3世代のDGXサーバーでのみ利用可能でした。[9] DGX A100には、15TBのPCIe Gen 4 NVMeストレージ、[22] 2つの64コアAMD Rome 7742 CPU、1TBのRAM、およびMellanox搭載のHDR InfiniBandインターコネクトも含まれています。DGX A100の初期価格は199,000ドルでした。[9]

DGXで使用されるアクセラレータの比較: [23] [24] [25]

モデル建築ソケットFP32
CUDA
コア
FP64 コア
(Tensor を除く)

INT32/FP32
コアの混合
INT32
コア
ブースト
クロック
メモリ
クロック
メモリ
バス幅
メモリ
帯域幅
VRAM単精度(
FP32
倍精度(
FP64
INT8
(非テンソル)
INT8
密テンソル
INT32FP4
密テンソル
FP16FP16
密テンソル
bfloat16
密テンソル
TensorFloat-32
(TF32)
密テンソル
FP64
密テンソル
インターコネクト
(NVLink)
グラフィックL1キャッシュL2キャッシュTDPダイサイズトランジスタ
プロセス発売
P100パスカルSXM/SXM235841792該当なし該当なし1480MHz1.4 ギガビット/秒 HBM24096ビット720 GB/秒16 GB HBM210.6 TFLOPS5.3 TFLOPS該当なし該当なし該当なし該当なし21.2 TFLOPS該当なし該当なし該当なし該当なし160 GB/秒GP1001344 KB (24 KB × 56)4096 KB300ワット610 mm 2153億TSMC 16FF+2016年第2四半期
V100 16GBボルタSXM251202560該当なし51201530MHz1.75 ギガビット/秒 HBM24096ビット900 GB/秒16 GB HBM215.7 TFLOPS7.8 TFLOPS62トップス該当なし15.7トップス該当なし31.4 TFLOPS125 TFLOPS該当なし該当なし該当なし300 GB/秒GV10010240 KB (128 KB × 80)6144 KB300ワット815 mm 221.1億TSMC 12FFN2017年第3四半期
V100 32GBボルタSXM351202560該当なし51201530MHz1.75 ギガビット/秒 HBM24096ビット900 GB/秒32 GB HBM215.7 TFLOPS7.8 TFLOPS62トップス該当なし15.7トップス該当なし31.4 TFLOPS125 TFLOPS該当なし該当なし該当なし300 GB/秒GV10010240 KB (128 KB × 80)6144 KB350ワット815 mm 221.1億TSMC 12FFN
A100 40GBアンペアSXM4691234566912該当なし1410MHz2.4 ギガビット/秒 HBM25120ビット1.52 TB/秒40 GB HBM219.5 TFLOPS9.7 TFLOPS該当なし624トップス19.5トップス該当なし78 TFLOPS312 TFLOPS312 TFLOPS156 TFLOPS19.5 TFLOPS600 GB/秒GA10020736 KB (192 KB × 108)40960 KB400ワット826 mm 254.2億TSMC N72020年第1四半期
A100 80GBアンペアSXM4691234566912該当なし1410MHz3.2 ギガビット/秒 HBM2e5120ビット1.52 TB/秒80 GB HBM2e19.5 TFLOPS9.7 TFLOPS該当なし624トップス19.5トップス該当なし78 TFLOPS312 TFLOPS312 TFLOPS156 TFLOPS19.5 TFLOPS600 GB/秒GA10020736 KB (192 KB × 108)40960 KB400ワット826 mm 254.2億TSMC N7
H100ホッパーSXM516896460816896該当なし1980MHz5.2 ギガビット/秒 HBM35120ビット3.35 TB/秒80 GB HBM367 TFLOPS34 TFLOPS該当なし1.98 ポップス該当なし該当なし該当なし990 TFLOPS990 TFLOPS495 TFLOPS67 TFLOPS900 GB/秒GH10025344 KB (192 KB × 132)51200 KB700ワット814 mm 280 BTSMC 4N2022年第3四半期
H200ホッパーSXM516896460816896該当なし1980MHz6.3 ギガビット/秒 HBM3e6144ビット4.8 TB/秒141 GB HBM3e67 TFLOPS34 TFLOPS該当なし1.98 ポップス該当なし該当なし該当なし990 TFLOPS990 TFLOPS495 TFLOPS67 TFLOPS900 GB/秒GH10025344 KB (192 KB × 132)51200 KB1000ワット814 mm 280 BTSMC 4N2023年第3四半期
B100ブラックウェルSXM6該当なし該当なし該当なし該当なし該当なし8 ギガビット/秒 HBM3e8192ビット8 TB/秒192 GB HBM3e該当なし該当なし該当なし3.5 ポップス該当なし7 PFLOPS該当なし1.98 PFLOPS1.98 PFLOPS989 TFLOPS30テラフロップス1.8 TB/秒GB100該当なし該当なし700ワット該当なし208 BTSMC 4NP2024年第4四半期
B200ブラックウェルSXM6該当なし該当なし該当なし該当なし該当なし8 ギガビット/秒 HBM3e8192ビット8 TB/秒192 GB HBM3e該当なし該当なし該当なし4.5 ポップス該当なし9 PFLOPS該当なし2.25 PFLOPS2.25 PFLOPS1.2 PFLOPS40 TFLOPS1.8 TB/秒GB100該当なし該当なし1000ワット該当なし208 BTSMC 4NP

Ampereを使用した製品

  • GeForce MXシリーズ
    • GeForce MX570(モバイル)(GA107)
  • GeForce 20シリーズ
    • GeForce RTX 2050(モバイル)(GA107)
  • GeForce 30シリーズ
    • GeForce RTX 3050 ノート PC GPU (GA107)
    • GeForce RTX 3050(GA106またはGA107)[26]
    • GeForce RTX 3050 Ti ノート PC GPU (GA107)
    • GeForce RTX 3060 ノート PC GPU (GA106)
    • GeForce RTX 3060(GA106またはGA104)[27]
    • GeForce RTX 3060 Ti(GA104またはGA103)[28]
    • GeForce RTX 3070 ノート PC GPU (GA104)
    • GeForce RTX 3070 (GA104)
    • GeForce RTX 3070 Ti ノート PC GPU (GA104)
    • GeForce RTX 3070 Ti(GA104またはGA102)[29]
    • GeForce RTX 3080 ノート PC GPU (GA104)
    • GeForce RTX 3080 (GA102)
    • GeForce RTX 3080 12GB (GA102)
    • GeForce RTX 3080 Ti ノート PC GPU (GA103)
    • GeForce RTX 3080 Ti (GA102)
    • GeForce RTX 3090 (GA102)
    • GeForce RTX 3090 Ti (GA102)
  • Nvidia ワークステーション GPU (旧Quadro )
    • RTX A1000(モバイル)(GA107)
    • RTX A2000(モバイル)(GA106)
    • RTX A2000(GA106)
    • RTX A3000(モバイル)(GA104)
    • RTX A4000(モバイル)(GA104)
    • RTX A4000 (GA104)
    • RTX A5000(モバイル)(GA104)
    • RTX A5500(モバイル)(GA103)
    • RTX A4500 (GA102)
    • RTX A5000(GA102)
    • RTX A5500(GA102)
    • RTX A6000(GA102)
    • A800 アクティブ
  • Nvidia データセンター GPU (旧Tesla )
    • エヌビディアA2(GA107)
    • エヌビディアA10(GA102)
    • Nvidia A16 (4 × GA107)
    • エヌビディアA30(GA100)
    • エヌビディアA40(GA102)
    • エヌビディアA100(GA100)
    • Nvidia A100 80 GB (GA100)
    • エヌビディアA100X
    • NVIDIA A30X
アンペアを使用する製品(チップあたり)
タイプGA10BGA107GA106GA104GA103GA102GA100
GeForce MXシリーズGeForce MX570(モバイル)
GeForce 20シリーズGeForce RTX 2050(モバイル)
GeForce 30シリーズGeForce RTX 3050 ノート PC
GeForce RTX 3050
GeForce RTX 3050 Ti ノート PC
GeForce RTX 3050
GeForce RTX 3060 ノートPC
GeForce RTX 3060
GeForce RTX 3060
GeForce RTX 3060 Ti
GeForce RTX 3070 ノート PC
GeForce RTX 3070
GeForce RTX 3070 Ti ノート PC
GeForce RTX 3070 Ti
GeForce RTX 3080 ノート PC
GeForce RTX 3060 Ti
GeForce RTX 3080 Ti ノート PC
GeForce RTX 3070 Ti
GeForce RTX 3080
GeForce RTX 3080 Ti
GeForce RTX 3090
GeForce RTX 3090 Ti
Nvidia ワークステーション GPURTX A1000(モバイル)RTX A2000 (モバイル)
RTX A2000
RTX A3000 (モバイル)
RTX A4000 (モバイル)
RTX A4000
RTX A5000 (モバイル)
RTX A5500(モバイル)RTX A4500
RTX A5000
RTX A5500
RTX A6000
Nvidia データセンター GPUエヌビディアA2
エヌビディアA16
エヌビディアA10
エヌビディアA40
エヌビディア A30
エヌビディア A100
Tegra SoCAGX オリン
オリン NX
オリン ナノ

参照

参考文献

  1. ^ 「NVIDIAの新しいAmpereデータセンターGPUが本格生産開始」NVIDIAニュース、2020年5月14日。
  2. ^ Krashinsky, Ronny; Giroux, Olivier; Jones, Stephen; Stam, Nick; Ramaswamy, Sridhar (2020年5月14日). 「NVIDIA Ampere アーキテクチャの詳細」. NVIDIA 開発者ブログ.
  3. ^ 「NVIDIA、GeForce RTX 30シリーズGPUで史上最大の世代的飛躍を実現」Nvidia Newsroom . 2020年9月1日. 2023年4月9日閲覧
  4. ^ 「NVIDIA GeForce Ultimate カウントダウン」。Nvidia
  5. ^ 「NVIDIAがA100 80GB GPUを倍増、AIスーパーコンピューティング向けに世界最強のGPUをスーパーチャージ」NVIDIA Newsroom 2020年11月16日. 2023年4月9日閲覧
  6. ^ 「CES 2023 における NVIDIA GeForce Beyond」。NVIDIA
  7. ^ 「I.7. Compute Capability 8.x」。Nvidia 2020年9月23日閲覧
  8. ^ Bosnjak, Dominik (2020年9月1日). 「NVIDIAの巨大なAmpereカードの心臓部にあるSamsungの古い8nm技術」. SamMobile . 2020年9月19日閲覧
  9. ^ abcde Smith, Ryan (2020年5月14日). 「NVIDIA Ampere Unleashed: NVIDIA が新GPUアーキテクチャ、A100 GPU、アクセラレータを発表」. AnandTech. 2020年5月14日時点のオリジナルよりアーカイブ。
  10. ^ Delgado, Gerardo (2020年9月1日). 「GeForce RTX 30シリーズGPU:AV1デコードでビデオコンテンツの新時代を切り開く」. Nvidia . 2023年4月9日閲覧
  11. ^ Morgan, Timothy Prickett (2020年5月29日). 「Nvidia Ampere GPUアーキテクチャの深掘り」The Next Platform . 2022年3月24日閲覧
  12. ^ 「NVIDIA A100 TensorコアGPUアーキテクチャ:あらゆるスケールで前例のない高速化」(PDF) . Nvidia . 2020年9月18日閲覧
  13. ^ 「NVIDIA Tensor コア: HPC と AI の多様性」。NVIDIA
  14. ^ 「要約」. docs.nvidia.com .
  15. ^ 「NVIDIA A100 TensorコアGPUアーキテクチャ」(PDF) . NVIDIA Corporation . 2024年4月29日閲覧
  16. ^ 「NVIDIA GA102 GPUの仕様」。TechPowerUp 2024年4月29日閲覧
  17. ^ 「NVIDIA GA103 GPUの仕様」。TechPowerUp 2024年4月29日閲覧
  18. ^ 「NVIDIA GA104 GPUの仕様」。TechPowerUp 2024年4月29日閲覧
  19. ^ 「NVIDIA GA106 GPUの仕様」。TechPowerUp 2024年4月29日閲覧
  20. ^ 「NVIDIA GA107 GPUの仕様」。TechPowerUp 2024年4月29日閲覧
  21. ^ 「NVIDIA AGX Orin シリーズ テクニカル ブリーフ v1.2」(PDF)エヌビディア社2024 年4 月 29 日に取得
  22. ^ Tom Warren、James Vincent (2020年5月14日). 「Nvidia初のAmpere GPUはデータセンターとAI向けに設計されており、PC向けではない」The Verge.
  23. ^ ライアン・スミス(2022年3月22日)「NVIDIA Hopper GPUアーキテクチャとH100アクセラレータ発表:よりスマートに、よりハードに」AnandTech。
  24. ^ ライアン・スミス(2020年5月14日)「NVIDIA Ampereの解放:NVIDIAが新しいGPUアーキテクチャ、A100 GPU、アクセラレータを発表」AnandTech。
  25. ^ 「NVIDIA Tesla V100をテスト:信じられないほどのGPUパワー」TweakTown、2017年9月17日。
  26. ^ Igor, Walllossek (2022年2月13日). 「GeForce RTX 3050 8GBの2つの側面」. Igor's Lab . 2022年2月23日閲覧
  27. ^ Shilov, Anton (2021年9月25日). 「GainwardとGalaxがGA104 GPU搭載のGeForce RTX 3060カードをリストアップ」. Tom's Hardware . 2022年9月23日閲覧
  28. ^ Tyson, Mark (2022年2月23日). 「Zotac、GA103 GPUを搭載した初のRTX 3060 Tiデスクトップカードを発表」. Tom's Hardware . 2022年9月23日閲覧
  29. ^ WhyCry (2022年10月26日). 「ZOTAC が GA102-150 GPU を搭載した GeForce RTX 3070 Ti を発売」。ビデオカード2023 年5 月 21 日に取得
  30. ^ 「Nintendo Switch 2の分解でNvidia Tegra T239チップ、SK Hynixメモリなどの詳細が判明」TechSpot . 2025年4月24日. 2025年5月31日閲覧
  • Nvidia A100 Tensor Core GPU アーキテクチャのホワイトペーパー
  • Nvidia Ampere GA102 GPUアーキテクチャのホワイトペーパー
  • Nvidia Ampere アーキテクチャ
  • Nvidia A100 Tensor コア GPU
  • Nvidia Ampere アーキテクチャの詳細
「https://en.wikipedia.org/w/index.php?title=Ampere_(microarchitecture)&oldid=1316143897#A100_accelerator_and_DGX_A100」より取得