Вопрос «какой сервер для нейросетей купить» почти всегда сводится к одному: какая видеокарта и сколько видеопамяти. Процессор и диски важны, но именно GPU определяет, какую модель вы сможете запустить, с каким контекстом и скоростью. Ниже: практические ориентиры по выбору GPU под инференс и обучение, без маркетинга и с честными оговорками там, где однозначного ответа нет.
Почему для нейросетей нужен именно GPU
Нейросеть по сути представляет собой огромное количество матричных умножений, выполняемых параллельно. Центральный процессор устроен для последовательных задач с малым числом мощных ядер, а видеокарта содержит тысячи простых ядер, которые одновременно перемножают числа. Для инференса и тем более для обучения это разница на порядки: то, что на CPU считается часами, на GPU считается минутами или секундами.
Экосистема NVIDIA CUDA служит отдельной причиной того, почему выбор почти всегда падает на NVIDIA. Большинство фреймворков (PyTorch, TensorFlow) и библиотек инференса (vLLM, llama.cpp, TensorRT-LLM) оптимизированы в первую очередь под CUDA. Альтернативы существуют, но требуют больше возни с совместимостью, поэтому для рабочего сервера это обычно не оправдано.
Главный параметр: объём видеопамяти (VRAM)

Если сравнивать видеокарты для ИИ по одному числу, это число: объём VRAM в гигабайтах. Именно видеопамять определяет:
- какого размера модель (в параметрах) вообще поместится на карту целиком или потребует разбиения между несколькими GPU;
- какой длины контекст (промпт + история диалога) можно обрабатывать: KV-кэш растёт вместе с контекстом и тоже съедает VRAM;
- какой batch size доступен при обучении или дообучении: от этого зависит скорость сходимости;
- в каком формате хранить веса: FP16/BF16, INT8 или ещё более агрессивное квантование INT4, чтобы модель влезла в имеющуюся память.
Мощность вычислительных ядер влияет на скорость, но если модель физически не помещается в VRAM, сервер её не запустит, вне зависимости от быстроты GPU. Поэтому при подборе конфигурации в первую очередь считают объём видеопамяти, и только потом производительность.
Инференс против обучения: разница в требованиях
Инференс (использование готовой модели)
При инференсе в память нужно загрузить только веса модели (плюс KV-кэш под контекст). Обратного прохода и хранения градиентов нет, поэтому требования к VRAM минимальны из всех сценариев. Одна карта с 16–24 ГБ уверенно тянет модели среднего размера в квантованном виде.
Обучение и дообучение (fine-tuning)
Обучение требует кратно больше памяти, чем инференс той же модели. На каждый параметр модели дополнительно нужно хранить:
- градиенты: примерно тот же объём, что и веса;
- состояния оптимизатора (например, Adam хранит два дополнительных тензора на параметр), это может удваивать-утраивать нагрузку;
- активации промежуточных слоёв для обратного прохода, растущие с batch size и длиной последовательности.
В сумме полное дообучение модели среднего размера может требовать в 4–6 раз больше VRAM, чем её инференс. Отсюда и практика: для дообучения крупных моделей почти всегда нужен либо мульти-GPU сервер, либо техники экономии памяти: LoRA/QLoRA, которые обучают лишь малую добавочную часть весов и резко снижают требования к памяти на одной карте.
Ориентиры по размеру LLM и объёму VRAM
Грубое эмпирическое правило для инференса в 16-битной точности: на 1 миллиард параметров модели нужно порядка 2 ГБ VRAM, плюс запас под контекст. При INT8/INT4-квантовании эта цифра снижается в 2–4 раза ценой небольшой потери качества. Ориентировочные пороги:
- 7–13B параметров: 16–24 ГБ VRAM на инференс в квантованном виде; комфортно работает на одной потребительской карте.
- 30–34B параметров: от 24 ГБ при агрессивном квантовании до 48 ГБ в более высокой точности.
- 70B и выше: одной картой уже почти никогда не обойтись: либо мульти-GPU связка из нескольких карт по 24–48 ГБ, либо профессиональные ускорители с 80 ГБ VRAM (класс H100/A100), которые вмещают такие модели с меньшим числом карт.
- Модели уровня DeepSeek и другие крупные MoE-архитектуры: практический локальный запуск и тем более дообучение требует мульти-GPU сервера: несколько карт объединяются, чтобы суммарного объёма VRAM хватило на все активные веса модели.
Это ориентиры, а не гарантия: точная потребность в памяти зависит от квантования, длины контекста, конкретной архитектуры и библиотеки инференса.
Таблица: задача ИИ → класс GPU и объём VRAM
| Задача | Рекомендуемый класс GPU | Ориентир по VRAM |
|---|---|---|
| Инференс LLM 7–13B, чат-боты, RAG | Потребительская RTX (одна карта) | 16–24 ГБ |
| Инференс LLM 30–34B, генерация изображений (Stable Diffusion и аналоги) | RTX старшего сегмента / одна проф. карта | 24–48 ГБ |
| LoRA/QLoRA дообучение моделей 7–13B | Одна карта повышенной ёмкости | 24–48 ГБ |
| Инференс LLM 70B+, локальный запуск крупных MoE-моделей | Мульти-GPU сервер (несколько карт) или карты 80 ГБ | от 80 ГБ суммарно и выше |
| Полное обучение/масштабное дообучение крупных моделей | A100/H100, объединённые NVLink | 80 ГБ на карту, несколько карт |
| Обучение с нуля больших моделей, промышленные ML-пайплайны | Кластер H100 (DGX-класс) | 8× 80 ГБ и выше |
NVLink и интерконнект: зачем он в мульти-GPU серверах
Когда модель не помещается на одну карту, её веса распределяют между несколькими GPU, которые должны непрерывно обмениваться промежуточными данными: скорость этого обмена становится узким местом. Обычная шина PCIe при интенсивном обучении на нескольких картах ограничивает пропускную способность. NVLink представляет собой прямое высокоскоростное соединение между GPU в обход PCIe, оно снимает это ограничение и позволяет картам работать почти как единый ускоритель с суммарной видеопамятью. Для A100/H100 NVLink выступает стандартной опцией; в мульти-GPU сборках на потребительских картах интерконнект обычно ограничен PCIe, что нормально для инференса, но заметно сказывается на скорости обучения.
Системная память и диски под датасеты

GPU выступает центральным элементом, но не единственным:
- Системная ОЗУ. Для инференса достаточно скромного объёма: данные живут в VRAM. Для обучения, особенно с offloading части весов или оптимизатора в память (когда VRAM не хватает), нужен большой запас, обычно 128–512 ГБ на сервер, особенно с ECC/REG-модулями для стабильности при длительных вычислениях. Подобрать модули можно в разделе оперативной памяти.
- Диски. Датасеты занимают от десятков до сотен гигабайт и должны читаться быстро, иначе GPU простаивают в ожидании данных. NVMe SSD служит стандартом для рабочего каталога с датасетами; HDD годится разве что для архивного хранения.
Локальный запуск против облака
Облако (аренда GPU-инстансов) хорошо для разовых экспериментов и пиковых нагрузок: не нужно вкладываться в оборудование заранее. Но при постоянной работе, будь то локальный запуск LLM (в том числе моделей класса DeepSeek), инференс с конфиденциальными данными или регулярное дообучение, собственный сервер выгоднее в пересчёте на месяц и снимает вопрос конфиденциальности: данные не покидают инфраструктуру компании. Плюс предсказуемая производительность без «шумных соседей» и риска, что нужный GPU закончится у провайдера в пиковый момент.
Классы карт: от входного уровня до профессионального
- RTX (потребительский и prosumer сегмент): оптимальный вход в тему: инференс небольших и средних моделей, генерация изображений, LoRA-дообучение, рендер. Хорошее соотношение цены и VRAM на карту.
- A100 / H100 (профессиональный ускоритель): 80 ГБ HBM-памяти на карту, NVLink, оптимизация под обучение и инференс в промышленных масштабах. Выбор для больших моделей, мульти-GPU обучения и продакшн-нагрузок с высокими требованиями к отказоустойчивости.
Подробнее с актуальными моделями профессиональных ускорителей можно ознакомиться в разделе профессиональных видеокарт для искусственного интеллекта.
Как рассчитать VRAM под модель и контекст
Базовый расчёт: вес модели = число параметров × байт на параметр. FP16/BF16 — 2 байта, INT8 — 1, INT4 — 0.5. Llama-3-8B в FP16 занимает ~16 ГБ, в INT4 — ~4.7 ГБ. Но это только веса.
KV-кэш считается по формуле: 2 × n_layers × n_kv_heads × head_dim × seq_len × batch × bytes. Множитель 2 — отдельно Key и Value. Для Llama-3-8B (32 слоя, 8 KV-голов, head_dim 128) при контексте 8192 токенов, batch 1, FP16: 2 × 32 × 8 × 128 × 8192 × 2 ≈ 1.07 ГБ. При 32k контекста — уже ~4.3 ГБ. Модели с GQA тратят в 4-8 раз меньше, чем с MHA.
Накладные расходы: CUDA-контекст 300-600 МБ на карту, фреймворк 1-2 ГБ, буферы активаций при инференсе 5-10% от весов. Для обучения добавляйте оптимизатор (Adam — 2 состояния по 4 байта на параметр), градиенты (2 байта), активации. Полное дообучение 8B в mixed precision требует 80-120 ГБ VRAM, LoRA — 16-24 ГБ.
Практическое правило: сумма весов + KV-кэш + 20% запаса. Для vLLM ставьте —gpu-memory-utilization 0.9, он сам распределит KV-кэш в остатке. Если не влезает — квантование, уменьшение контекста, tensor parallelism на 2+ GPU.
Потребительские против профессиональных GPU
| GPU | VRAM | TDP | Память | Цена |
|---|---|---|---|---|
| RTX 4090 | 24 ГБ GDDR6X | 450 Вт | 1008 ГБ/с | ~1600-2000 $ |
| RTX 5090 | 32 ГБ GDDR7 | 575 Вт | ~1792 ГБ/с | ~2000-2500 $ |
| RTX A6000 | 48 ГБ GDDR6 | 300 Вт | 768 ГБ/с | ~4500-5000 $ |
| RTX 6000 Ada | 48 ГБ GDDR6 | 300 Вт | 960 ГБ/с | ~6800-8000 $ |
| A100 80GB | 80 ГБ HBM2e | 400 Вт | 2039 ГБ/с | ~10000-15000 $ |
| H100 80GB | 80 ГБ HBM3 | 350-700 Вт | 3350 ГБ/с | ~25000-30000 $ |
Потребительские карты выигрывают по цене за гигабайт и сырой FP16-производительности, но у них нет NVLink, ECC-памяти, MIG и нормального blower-охлаждения. GeForce EULA формально запрещает использование в датацентрах. Профессиональные GPU дают ECC, NVLink, MIG, драйверы datacenter и 2-слотовое исполнение для плотной установки. Для инференса LLM ключева пропускная способность памяти: H100 быстрее 4090 в 3+ раза на токен/с. Для обучения важны FP16/BF16 TFLOPS и интерконнект: 4x 4090 на PCIe масштабируются плохо, 4x A100 с NVLink — почти линейно.
Питание, охлаждение и корпус
Считайте мощность по пику: 4x RTX 4090 = 1800 Вт только GPU, плюс CPU 200-350 Вт, плата, диски, вентиляторы — итого 2300-2500 Вт. Нужен БП 2×1600 Вт с резервированием или 3000 Вт Titanium. 8x H100 SXM = 5600 Вт, с двумя CPU — 6300 Вт, это 4x 3000 Вт или 3-фазное питание. Разъёмы: 12VHPWR на 600 Вт для каждой карты, не используйте daisy-chain. Для CPU — 8-pin EPS.
Охлаждение: 4x 4090 в 4U — только blower-версии или водоблоки. Референсные 3-слотовые карты физически не встают больше двух. Вода: 4 GPU-блока + 2 радиатора 480 мм, поток 2 л/мин на GPU. Воздух: 8 вентиляторов 80 мм на 15k RPM, фронт-в-тыл, статическое давление. Корпус: 4U rackmount, например Supermicro SYS-421GE или AS-4124GS. PCIe: для 4x x16 нужно 128 линий — даёт dual EPYC 9004. Райзеры PCIe 4.0/5.0. NVLink-мост для A100/H100 SXM через NVSwitch. Температура в стойке 20-25 °C, иначе throttling.
Программный стек для запуска
Драйвер: NVIDIA 550+ под CUDA 12.4 или 535 под CUDA 12.2. Проверка: nvidia-smi, nvtop. Docker: nvidia-container-toolkit, запуск с —gpus all. Базовые образы: nvcr.io/nvidia/pytorch:24.05-py3, nvcr.io/nvidia/tritonserver. vLLM: pip install vllm, затем python -m vllm.entrypoints.openai.api_server —model meta-llama/Meta-Llama-3-8B-Instruct —tensor-parallel-size 2 —gpu-memory-utilization 0.9. Даёт OpenAI-совместимый API, PagedAttention и непрерывный батчинг.
Ollama: ollama run llama3:70b, внутри llama.cpp и GGUF, умеет offload на CPU+GPU, удобен для одного пользователя. TensorRT-LLM даёт максимальную скорость, но требует сборки engine под конкретную модель и GPU. Для обучения: PyTorch 2.x, DeepSpeed, FSDP, HuggingFace Accelerate. Версия CUDA должна совпадать с сборкой PyTorch. NGC-контейнеры избавляют от конфликтов зависимостей. Для A100/H100 доступен MIG: nvidia-smi mig -cgi. Для NVSwitch нужен nvidia-fabricmanager. Не смешивайте драйверы и CUDA из разных веток на одном сервере.
Готовые конфигурации в нашем каталоге
Вместо того чтобы собирать GPU-сервер по частям, можно отталкиваться от готовых конфигураций, рассчитанных под конкретный класс задач:
- HUANANZHI HN-PC-FARM4U4: GPU-ферма форм-фактора 4U с 4 независимыми узлами, по одной видеокарте NVIDIA серии RTX 40/50 на узел. Подходит для параллельного инференса, рендера и задач, которые не требуют объединения карт в единый вычислительный пул. Цена по запросу, конфигурация под задачу.
- HUANANZHI DeepSeek: мульти-GPU сервер на платформе X99 с 2 процессорами Xeon E5 v3/v4, 128–512 ГБ DDR4 ECC/REG и несколькими видеокартами NVIDIA, от RTX до A100/H100 в конфигурации. Рассчитан на локальный запуск крупных языковых моделей и их дообучение. Цена и состав GPU по запросу.
- NVIDIA DGX H100: флагманская платформа с 8 картами H100 SXM5 по 80 ГБ, 2 процессорами Xeon Platinum 8480CL и 2 ТБ DDR5. Решение для обучения крупнейших моделей и промышленных ML-пайплайнов, где важна максимальная суммарная VRAM и NVLink-интерконнект между всеми картами.
Все конфигурации и модели GPU для ИИ-задач собраны в разделе серверов для искусственного интеллекта.
Заключение
Выбор GPU для нейросетей начинается не с бренда или тактовой частоты, а с ответа на два вопроса: какого размера модель нужно запускать и что именно вы делаете, инференс или обучение. Для инференса моделей 7–13B достаточно одной карты с 16–24 ГБ VRAM. Для обучения и дообучения запросы по памяти вырастают в разы, а для моделей от 70B и выше практически всегда нужен мульти-GPU сервер или карты уровня H100 с 80 ГБ VRAM и NVLink. Ошибка в сторону меньшей видеопамяти обходится дороже, чем в сторону вычислительной мощности: недостаточно быстрая карта просто работает медленнее, а карта с нехваткой VRAM не запустит модель вовсе.
Если не уверены, какая конфигурация подойдёт под ваши модели и объём задач, опишите сценарий (размер моделей, инференс или обучение, число одновременных пользователей), и мы подберём сервер под конкретную нагрузку в разделе серверов для искусственного интеллекта.
Прежде чем считать вычислительную мощность GPU, посчитайте требуемый объём VRAM с запасом 20-30% сверх «сухого» размера весов модели: контекст, KV-кэш и служебные буферы съедают память быстрее, чем кажется на старте. Карта, которая впритык вмещает модель без контекста, на практике окажется бесполезной уже при первом длинном диалоге.
Частые ошибки при выборе GPU-сервера для нейросетей
- Выбирают GPU по производительности (TFLOPS), забыв, что модель, которая физически не помещается в VRAM карты, не запустится вообще, независимо от скорости вычислений.
- Планируют дообучение модели по тем же требованиям к VRAM, что и инференс, хотя обучение требует в 4-6 раз больше памяти из-за градиентов, состояний оптимизатора и активаций.
- Собирают мульти-GPU сервер на потребительских картах через обычный PCIe и ожидают такой же прирост скорости обучения, как на связке с NVLink, хотя интерконнект здесь становится узким местом.
- Экономят на системной ОЗУ и NVMe-накопителях под датасеты, в результате дорогой GPU простаивает в ожидании данных с медленного диска или скромного объёма памяти при offloading.
