Запуск LLM на AMD RX 7800 XT (Посібник з ROCm)
Посібник надано Ian Wirtz
Рекомендовано: LM Studio (
lms) — сервер інференсу, який використовує Elite Intel.
Передумови
Крок 1 Встановлення rocm-hip-runtime
Перш ніж LM Studio зможе використовувати вашу відеокарту через ROCm, система потребує базових бібліотек HIP у просторі користувача для взаємодії з драйвером ядра.
Arch Linux / CachyOS:
sudo pacman -S rocm-hip-runtime
Ubuntu / Debian:
sudo apt install rocm-hip-runtime
Fedora:
sudo dnf install rocm-hip-runtime
Права доступу до GPU: Ваш користувач повинен належати до груп
renderтаvideo. Перевірте за допомогою:groupsЯкщо якась група відсутня, додайте себе:
sudo usermod -aG video,render $USERНеобхідно повністю вийти та увійти знову (або перезавантажитися), щоб зміна групи набула чинності.
Крок 2 Встановлення rocm-smi (може бути необов'язковим)
На дистрибутивах з швидким циклом оновлення, як-от Arch, інструменти управління не завжди підтягуються як суворі залежності rocm-hip-runtime. Встановіть їх явно, щоб уникнути несумісності версій бібліотек.
Arch Linux / CachyOS:
sudo pacman -S rocm-smi-lib
Ubuntu / Debian:
Debian розділяє інструмент командного рядка та його бібліотеку виконання на окремі пакети.
# Інструмент моніторингу командного рядка
sudo apt update && sudo apt install rocm-smi
# Бібліотеки виконання
sudo apt update && sudo apt install librocm-smi64-1
Порада: Якщо точна назва пакету невідома, введіть
sudo apt install librocm-smi64і натисніть Tab для автодоповнення поточного суфікса версії.
Fedora:
# Інструмент командного рядка
sudo dnf install rocm-smi
# Бібліотеки та заголовки для розробки C/C++ (еквівалент rocm-smi-lib на Arch)
sudo dnf install rocm-smi-devel
Запуск моделі
| Модель | Потрібно VRAM | Примітки |
|---|---|---|
google/gemma-4-e4b |
~6.3 GB | ✅ Потрібно |
Чому саме ця модель? Вона підтримує виклик функцій, потрібний компаньйону. Модель, яка не вміє формувати виклик інструмента, не зможе керувати застосунком, хоч би як добре вона писала. Див. Обрати LLM.
Крок 3 Завантаження моделі з прискоренням ROCm
При виклику lms load явно вкажіть прапорці апаратного прискорення. Прапорець --gpu max вказує середовищу виконання завантажити всю модель у VRAM.
HSA_OVERRIDE_GFX_VERSION=11.0.0 lms load google/gemma-4-e4b --context-length 8192 --gpu max
Префікс HSA_OVERRIDE_GFX_VERSION=11.0.0 повідомляє стеку ROCm, щоб він розглядав RX 7800 XT як підтримувану обчислювальну ціль, обходячи тихі відмови з переходом на резервний варіант.
Крок 4 Збереження конфігурації назавжди
Щоб не додавати змінну середовища перед кожною командою, додайте її до профілю вашої оболонки.
Bash:
echo 'export HSA_OVERRIDE_GFX_VERSION=11.0.0' >> ~/.bashrc
source ~/.bashrc
Fish (стандартна оболонка CachyOS) Варіант А: Глобальна змінна (рекомендовано)
Встановіть один раз; Fish автоматично зберігає її між перезавантаженнями без додаткової конфігурації:
set -Ux HSA_OVERRIDE_GFX_VERSION 11.0.0
Fish Варіант Б: Явний запис у конфігураційний файл
echo 'set -gx HSA_OVERRIDE_GFX_VERSION 11.0.0' >> ~/.config/fish/config.fish
source ~/.config/fish/config.fish
Перевірка
Крок 5 Підтвердження завантаження обчислювального драйвера ядра
Якщо команда зависає, обчислювальний шар ядра (amdkfd) може бути не ініціалізований. Перевірте, чи система розкриває вашу відеокарту як обчислювальну платформу ROCm:
rocminfo
Прокрутіть до початку виводу. Якщо бачите Can't open /dev/kfd або збій, ядро Linux не відкриває обчислювальний інтерфейс для простору користувача. Якщо ви використовуєте власне або передове ядро, спробуйте завантажитися з базовим або LTS-ядром (linux-lts), щоб виключити регресію драйвера.
Крок 6 Запуск сервера та перевірка використання VRAM
LM Studio:
lms server start
Потім підтвердіть, що модель завантажена у VRAM:
rocm-smi
В режимі очікування (модель не завантажена):

В режимі очікування відеокарта споживає мінімальну потужність (9 Вт), тактові частоти знаходяться поблизу мінімуму, а використання VRAM є низьким (44%).
Під навантаженням (модель + гра запущені одночасно):

При комбінованому навантаженні ви повинні побачити значне зростання використання VRAM (71% у цьому прикладі), підвищення утилізації GPU і відповідне збільшення енергоспоживання (~147 Вт). Це підтверджує, що модель знаходиться у VRAM та інференс виконується на GPU.