AI最新ニュース 2026.05.11
AMD ROCm 75倍高速化【2026年版】DeepSeek後のAI推論競争とセットアップ手順
DeepSeek公開がAMD ROCmを急進化させた
2025年末〜2026年初頭にDeepSeek V4(DeepSeek-R1系)がオープンソース公開されると、自社サーバーでLLMを動かしたいという需要が急増しました。NVIDIAのGPUは入手困難・高価なため、AMD GPU(Instinct MI-300X等)での実行需要も高まりました。
しかしROCmの初期対応は不十分で、DeepSeek V4の推論スループットが期待を下回っていました。Amdのエンジニアチームが集中的に改善を行い、わずか14日間で最大75倍の高速化を達成したと報告されています。
主な改善内容:
- GPUカーネル(GPU上の計算プログラム)の書き直し
- Flash Attention実装の最適化
- KVキャッシュのメモリ転送効率化
- バッチ処理パイプラインの並列化改善
ROCmのバージョンアップ手順(Ubuntu)
# 現在のROCmバージョンを確認
rocm-smi --version
# AMDのROCmリポジトリを追加(Ubuntu 22.04の例)
wget https://repo.radeon.com/amdgpu-install/latest/ubuntu/jammy/amdgpu-install_*.deb
sudo dpkg -i amdgpu-install_*.deb
sudo amdgpu-install --usecase=rocm
# ROCmのコアライブラリをアップデート
sudo apt update
sudo apt upgrade rocm-hip-sdk rocm-ml-sdk
# インストール確認
rocm-smi
rocminfo | grep "Agent 2" # GPU情報を確認
# PyTorchのROCm版をインストール
pip install torch torchvision torchaudio \
--index-url https://download.pytorch.org/whl/rocm6.0
# ROCm上でPyTorchが動作するか確認
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name())"
# True, AMD Instinct MI300X ... のように表示されれば成功
AMDでLlama・Qwenを動かす
llama.cpp(CPU/GPU両対応)
# llama.cppのROCm版をビルド
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make GGML_HIPBLAS=1 -j$(nproc)
# Qwen2.5-7Bモデルをダウンロード(GGUF形式)
wget https://huggingface.co/bartowski/Qwen2.5-7B-Instruct-GGUF/resolve/main/Qwen2.5-7B-Instruct-Q4_K_M.gguf
# AMD GPUで推論
./llama-cli \
-m Qwen2.5-7B-Instruct-Q4_K_M.gguf \
-p "日本語で、機械学習とは何かを200字以内で説明してください" \
--n-gpu-layers 32 \ # GPUに載せるレイヤー数
--ctx-size 4096
vLLM(ROCm対応版)
# ROCm対応vLLMをインストール
pip install vllm --extra-index-url https://download.pytorch.org/whl/rocm6.0
# サーバー起動
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--dtype bfloat16 \
--tensor-parallel-size 2 # AMD MI300X 2枚並列
# OpenAI互換APIとして使用
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")
response = client.chat.completions.create(
model="Qwen/Qwen2.5-7B-Instruct",
messages=[{"role": "user", "content": "日本語で説明して"}]
)
print(response.choices[0].message.content)
浮動小数点精度の選び方
推論速度と精度のトレードオフ:
| 形式 | ビット数 | 速度 | 精度 | 用途 |
|---|---|---|---|---|
| FP32 | 32bit | 遅い | 最高 | モデルの学習(一部) |
| FP16 | 16bit | 速い | 良好 | 推論・ファインチューニング |
| BF16 | 16bit | 速い | 安定 | AMD/Google TPU推奨 |
| FP8 | 8bit | 最速 | 低下あり | H100・MI300X対応 |
| INT4 | 4bit | 超高速 | 量子化 | GGUF/GPTQ形式 |
# PyTorchでの精度指定
import torch
# BF16推論(AMD GPUで推奨)
model = model.to(torch.bfloat16)
# FP16推論
model = model.to(torch.float16)
# 混合精度(学習時)
from torch.cuda.amp import autocast
with autocast(dtype=torch.bfloat16):
output = model(input)
NVIDIAとのコスト比較
| GPU | VRAM | 価格目安 | LLM推論性能 |
|---|---|---|---|
| NVIDIA H100 80GB | 80GB | $30,000〜 | 基準 |
| NVIDIA A100 80GB | 80GB | $10,000〜 | H100の約60% |
| AMD Instinct MI300X | 192GB | $15,000〜 | H100の80〜100%(ROCm最適化後) |
| NVIDIA RTX 4090 | 24GB | $1,800〜 | 消費者向け最高 |
| AMD RX 7900 XTX | 24GB | $900〜 | RTX 4090の60〜80%(ROCm次第) |
ROCmの大幅改善により、特にMI300Xは大容量VRAMとコストパフォーマンスでH100に対抗できる場面が増えています。
あわせて読みたい
- Nvidiaが警告:AI計算コストが人件費を超える時代に企業が取るべき3つの対策
- 8GB VRAMでLLMエージェントがクラッシュする原因と対策
- ローカルLLM運用で必ず計算すべきVRAMとトークン数 GPU破壊を防ぐ実践テク