Телефон
Электронная почта
Мессенджеры
Связаться со специалистом
Задать вопрос
Оставить заявку
Наш специалист перезвонит Вам в течение двух минут и детально проконсультирует

    Ваш номер телефона

    Ваше имя

    Ваш email

    Сообщение

    или
    Напишите нам в соц. сетях
    Остались вопросы?
    Наш специалист перезвонит Вам в течение двух минут и ответит на ваши вопросы

      Ваш номер телефона

      Ваше имя

      Ваш email

      Ваш вопрос

      или
      Напишите нам в соц. сетях
      Спасибо!
      Ваша заявка отправлена.
      Скоро мы свяжемся с вами
      или
      Напишите нам в соц. сетях
      Мы официальный представитель китайского завода HUANANZHITrade-in: зачтём вашу видеокарту до 20 000 ₽ →
      Каталог
      Каталог
      Связаться со специалистом
      0
      Всё о серверном железе

      Сервер для нейросетей: какие видеокарты нужны для инференса и обучения

      13 мин. чтения

      Вопрос «какой сервер для нейросетей купить» почти всегда сводится к одному: какая видеокарта и сколько видеопамяти. Процессор и диски важны, но именно GPU определяет, какую модель вы сможете запустить, с каким контекстом и скоростью. Ниже: практические ориентиры по выбору GPU под инференс и обучение, без маркетинга и с честными оговорками там, где однозначного ответа нет.

      Почему для нейросетей нужен именно GPU

      Нейросеть по сути представляет собой огромное количество матричных умножений, выполняемых параллельно. Центральный процессор устроен для последовательных задач с малым числом мощных ядер, а видеокарта содержит тысячи простых ядер, которые одновременно перемножают числа. Для инференса и тем более для обучения это разница на порядки: то, что на CPU считается часами, на GPU считается минутами или секундами.

      Экосистема NVIDIA CUDA служит отдельной причиной того, почему выбор почти всегда падает на NVIDIA. Большинство фреймворков (PyTorch, TensorFlow) и библиотек инференса (vLLM, llama.cpp, TensorRT-LLM) оптимизированы в первую очередь под CUDA. Альтернативы существуют, но требуют больше возни с совместимостью, поэтому для рабочего сервера это обычно не оправдано.

      Главный параметр: объём видеопамяти (VRAM)

      Серверная видеокарта крупным планом: чипы видеопамяти на плате

      Если сравнивать видеокарты для ИИ по одному числу, это число: объём VRAM в гигабайтах. Именно видеопамять определяет:

      • какого размера модель (в параметрах) вообще поместится на карту целиком или потребует разбиения между несколькими GPU;
      • какой длины контекст (промпт + история диалога) можно обрабатывать: KV-кэш растёт вместе с контекстом и тоже съедает VRAM;
      • какой batch size доступен при обучении или дообучении: от этого зависит скорость сходимости;
      • в каком формате хранить веса: FP16/BF16, INT8 или ещё более агрессивное квантование INT4, чтобы модель влезла в имеющуюся память.

      Мощность вычислительных ядер влияет на скорость, но если модель физически не помещается в VRAM, сервер её не запустит, вне зависимости от быстроты GPU. Поэтому при подборе конфигурации в первую очередь считают объём видеопамяти, и только потом производительность.

      Инференс против обучения: разница в требованиях

      Инференс (использование готовой модели)

      При инференсе в память нужно загрузить только веса модели (плюс KV-кэш под контекст). Обратного прохода и хранения градиентов нет, поэтому требования к VRAM минимальны из всех сценариев. Одна карта с 16–24 ГБ уверенно тянет модели среднего размера в квантованном виде.

      Обучение и дообучение (fine-tuning)

      Обучение требует кратно больше памяти, чем инференс той же модели. На каждый параметр модели дополнительно нужно хранить:

      • градиенты: примерно тот же объём, что и веса;
      • состояния оптимизатора (например, Adam хранит два дополнительных тензора на параметр), это может удваивать-утраивать нагрузку;
      • активации промежуточных слоёв для обратного прохода, растущие с batch size и длиной последовательности.

      В сумме полное дообучение модели среднего размера может требовать в 4–6 раз больше VRAM, чем её инференс. Отсюда и практика: для дообучения крупных моделей почти всегда нужен либо мульти-GPU сервер, либо техники экономии памяти: LoRA/QLoRA, которые обучают лишь малую добавочную часть весов и резко снижают требования к памяти на одной карте.

      Ориентиры по размеру LLM и объёму VRAM

      Грубое эмпирическое правило для инференса в 16-битной точности: на 1 миллиард параметров модели нужно порядка 2 ГБ VRAM, плюс запас под контекст. При INT8/INT4-квантовании эта цифра снижается в 2–4 раза ценой небольшой потери качества. Ориентировочные пороги:

      • 7–13B параметров: 16–24 ГБ VRAM на инференс в квантованном виде; комфортно работает на одной потребительской карте.
      • 30–34B параметров: от 24 ГБ при агрессивном квантовании до 48 ГБ в более высокой точности.
      • 70B и выше: одной картой уже почти никогда не обойтись: либо мульти-GPU связка из нескольких карт по 24–48 ГБ, либо профессиональные ускорители с 80 ГБ VRAM (класс H100/A100), которые вмещают такие модели с меньшим числом карт.
      • Модели уровня DeepSeek и другие крупные MoE-архитектуры: практический локальный запуск и тем более дообучение требует мульти-GPU сервера: несколько карт объединяются, чтобы суммарного объёма VRAM хватило на все активные веса модели.

      Это ориентиры, а не гарантия: точная потребность в памяти зависит от квантования, длины контекста, конкретной архитектуры и библиотеки инференса.

      Таблица: задача ИИ → класс GPU и объём VRAM

      Задача Рекомендуемый класс GPU Ориентир по VRAM
      Инференс LLM 7–13B, чат-боты, RAG Потребительская RTX (одна карта) 16–24 ГБ
      Инференс LLM 30–34B, генерация изображений (Stable Diffusion и аналоги) RTX старшего сегмента / одна проф. карта 24–48 ГБ
      LoRA/QLoRA дообучение моделей 7–13B Одна карта повышенной ёмкости 24–48 ГБ
      Инференс LLM 70B+, локальный запуск крупных MoE-моделей Мульти-GPU сервер (несколько карт) или карты 80 ГБ от 80 ГБ суммарно и выше
      Полное обучение/масштабное дообучение крупных моделей A100/H100, объединённые NVLink 80 ГБ на карту, несколько карт
      Обучение с нуля больших моделей, промышленные ML-пайплайны Кластер H100 (DGX-класс) 8× 80 ГБ и выше

      NVLink и интерконнект: зачем он в мульти-GPU серверах

      Когда модель не помещается на одну карту, её веса распределяют между несколькими GPU, которые должны непрерывно обмениваться промежуточными данными: скорость этого обмена становится узким местом. Обычная шина PCIe при интенсивном обучении на нескольких картах ограничивает пропускную способность. NVLink представляет собой прямое высокоскоростное соединение между GPU в обход PCIe, оно снимает это ограничение и позволяет картам работать почти как единый ускоритель с суммарной видеопамятью. Для A100/H100 NVLink выступает стандартной опцией; в мульти-GPU сборках на потребительских картах интерконнект обычно ограничен PCIe, что нормально для инференса, но заметно сказывается на скорости обучения.

      Системная память и диски под датасеты

      Несколько GPU в сервере, соединённые интерконнект-мостами

      GPU выступает центральным элементом, но не единственным:

      • Системная ОЗУ. Для инференса достаточно скромного объёма: данные живут в VRAM. Для обучения, особенно с offloading части весов или оптимизатора в память (когда VRAM не хватает), нужен большой запас, обычно 128–512 ГБ на сервер, особенно с ECC/REG-модулями для стабильности при длительных вычислениях. Подобрать модули можно в разделе оперативной памяти.
      • Диски. Датасеты занимают от десятков до сотен гигабайт и должны читаться быстро, иначе GPU простаивают в ожидании данных. NVMe SSD служит стандартом для рабочего каталога с датасетами; HDD годится разве что для архивного хранения.

      Локальный запуск против облака

      Облако (аренда GPU-инстансов) хорошо для разовых экспериментов и пиковых нагрузок: не нужно вкладываться в оборудование заранее. Но при постоянной работе, будь то локальный запуск LLM (в том числе моделей класса DeepSeek), инференс с конфиденциальными данными или регулярное дообучение, собственный сервер выгоднее в пересчёте на месяц и снимает вопрос конфиденциальности: данные не покидают инфраструктуру компании. Плюс предсказуемая производительность без «шумных соседей» и риска, что нужный GPU закончится у провайдера в пиковый момент.

      Классы карт: от входного уровня до профессионального

      • RTX (потребительский и prosumer сегмент): оптимальный вход в тему: инференс небольших и средних моделей, генерация изображений, LoRA-дообучение, рендер. Хорошее соотношение цены и VRAM на карту.
      • A100 / H100 (профессиональный ускоритель): 80 ГБ HBM-памяти на карту, NVLink, оптимизация под обучение и инференс в промышленных масштабах. Выбор для больших моделей, мульти-GPU обучения и продакшн-нагрузок с высокими требованиями к отказоустойчивости.

      Подробнее с актуальными моделями профессиональных ускорителей можно ознакомиться в разделе профессиональных видеокарт для искусственного интеллекта.

      Как рассчитать VRAM под модель и контекст

      Базовый расчёт: вес модели = число параметров × байт на параметр. FP16/BF16 — 2 байта, INT8 — 1, INT4 — 0.5. Llama-3-8B в FP16 занимает ~16 ГБ, в INT4 — ~4.7 ГБ. Но это только веса.

      KV-кэш считается по формуле: 2 × n_layers × n_kv_heads × head_dim × seq_len × batch × bytes. Множитель 2 — отдельно Key и Value. Для Llama-3-8B (32 слоя, 8 KV-голов, head_dim 128) при контексте 8192 токенов, batch 1, FP16: 2 × 32 × 8 × 128 × 8192 × 2 ≈ 1.07 ГБ. При 32k контекста — уже ~4.3 ГБ. Модели с GQA тратят в 4-8 раз меньше, чем с MHA.

      Накладные расходы: CUDA-контекст 300-600 МБ на карту, фреймворк 1-2 ГБ, буферы активаций при инференсе 5-10% от весов. Для обучения добавляйте оптимизатор (Adam — 2 состояния по 4 байта на параметр), градиенты (2 байта), активации. Полное дообучение 8B в mixed precision требует 80-120 ГБ VRAM, LoRA — 16-24 ГБ.

      Практическое правило: сумма весов + KV-кэш + 20% запаса. Для vLLM ставьте —gpu-memory-utilization 0.9, он сам распределит KV-кэш в остатке. Если не влезает — квантование, уменьшение контекста, tensor parallelism на 2+ GPU.

      Потребительские против профессиональных GPU

      GPU VRAM TDP Память Цена
      RTX 4090 24 ГБ GDDR6X 450 Вт 1008 ГБ/с ~1600-2000 $
      RTX 5090 32 ГБ GDDR7 575 Вт ~1792 ГБ/с ~2000-2500 $
      RTX A6000 48 ГБ GDDR6 300 Вт 768 ГБ/с ~4500-5000 $
      RTX 6000 Ada 48 ГБ GDDR6 300 Вт 960 ГБ/с ~6800-8000 $
      A100 80GB 80 ГБ HBM2e 400 Вт 2039 ГБ/с ~10000-15000 $
      H100 80GB 80 ГБ HBM3 350-700 Вт 3350 ГБ/с ~25000-30000 $

      Потребительские карты выигрывают по цене за гигабайт и сырой FP16-производительности, но у них нет NVLink, ECC-памяти, MIG и нормального blower-охлаждения. GeForce EULA формально запрещает использование в датацентрах. Профессиональные GPU дают ECC, NVLink, MIG, драйверы datacenter и 2-слотовое исполнение для плотной установки. Для инференса LLM ключева пропускная способность памяти: H100 быстрее 4090 в 3+ раза на токен/с. Для обучения важны FP16/BF16 TFLOPS и интерконнект: 4x 4090 на PCIe масштабируются плохо, 4x A100 с NVLink — почти линейно.

      Питание, охлаждение и корпус

      Считайте мощность по пику: 4x RTX 4090 = 1800 Вт только GPU, плюс CPU 200-350 Вт, плата, диски, вентиляторы — итого 2300-2500 Вт. Нужен БП 2×1600 Вт с резервированием или 3000 Вт Titanium. 8x H100 SXM = 5600 Вт, с двумя CPU — 6300 Вт, это 4x 3000 Вт или 3-фазное питание. Разъёмы: 12VHPWR на 600 Вт для каждой карты, не используйте daisy-chain. Для CPU — 8-pin EPS.

      Охлаждение: 4x 4090 в 4U — только blower-версии или водоблоки. Референсные 3-слотовые карты физически не встают больше двух. Вода: 4 GPU-блока + 2 радиатора 480 мм, поток 2 л/мин на GPU. Воздух: 8 вентиляторов 80 мм на 15k RPM, фронт-в-тыл, статическое давление. Корпус: 4U rackmount, например Supermicro SYS-421GE или AS-4124GS. PCIe: для 4x x16 нужно 128 линий — даёт dual EPYC 9004. Райзеры PCIe 4.0/5.0. NVLink-мост для A100/H100 SXM через NVSwitch. Температура в стойке 20-25 °C, иначе throttling.

      Программный стек для запуска

      Драйвер: NVIDIA 550+ под CUDA 12.4 или 535 под CUDA 12.2. Проверка: nvidia-smi, nvtop. Docker: nvidia-container-toolkit, запуск с —gpus all. Базовые образы: nvcr.io/nvidia/pytorch:24.05-py3, nvcr.io/nvidia/tritonserver. vLLM: pip install vllm, затем python -m vllm.entrypoints.openai.api_server —model meta-llama/Meta-Llama-3-8B-Instruct —tensor-parallel-size 2 —gpu-memory-utilization 0.9. Даёт OpenAI-совместимый API, PagedAttention и непрерывный батчинг.

      Ollama: ollama run llama3:70b, внутри llama.cpp и GGUF, умеет offload на CPU+GPU, удобен для одного пользователя. TensorRT-LLM даёт максимальную скорость, но требует сборки engine под конкретную модель и GPU. Для обучения: PyTorch 2.x, DeepSpeed, FSDP, HuggingFace Accelerate. Версия CUDA должна совпадать с сборкой PyTorch. NGC-контейнеры избавляют от конфликтов зависимостей. Для A100/H100 доступен MIG: nvidia-smi mig -cgi. Для NVSwitch нужен nvidia-fabricmanager. Не смешивайте драйверы и CUDA из разных веток на одном сервере.

      Готовые конфигурации в нашем каталоге

      Вместо того чтобы собирать GPU-сервер по частям, можно отталкиваться от готовых конфигураций, рассчитанных под конкретный класс задач:

      • HUANANZHI HN-PC-FARM4U4: GPU-ферма форм-фактора 4U с 4 независимыми узлами, по одной видеокарте NVIDIA серии RTX 40/50 на узел. Подходит для параллельного инференса, рендера и задач, которые не требуют объединения карт в единый вычислительный пул. Цена по запросу, конфигурация под задачу.
      • HUANANZHI DeepSeek: мульти-GPU сервер на платформе X99 с 2 процессорами Xeon E5 v3/v4, 128–512 ГБ DDR4 ECC/REG и несколькими видеокартами NVIDIA, от RTX до A100/H100 в конфигурации. Рассчитан на локальный запуск крупных языковых моделей и их дообучение. Цена и состав GPU по запросу.
      • NVIDIA DGX H100: флагманская платформа с 8 картами H100 SXM5 по 80 ГБ, 2 процессорами Xeon Platinum 8480CL и 2 ТБ DDR5. Решение для обучения крупнейших моделей и промышленных ML-пайплайнов, где важна максимальная суммарная VRAM и NVLink-интерконнект между всеми картами.

      Все конфигурации и модели GPU для ИИ-задач собраны в разделе серверов для искусственного интеллекта.

      Заключение

      Выбор GPU для нейросетей начинается не с бренда или тактовой частоты, а с ответа на два вопроса: какого размера модель нужно запускать и что именно вы делаете, инференс или обучение. Для инференса моделей 7–13B достаточно одной карты с 16–24 ГБ VRAM. Для обучения и дообучения запросы по памяти вырастают в разы, а для моделей от 70B и выше практически всегда нужен мульти-GPU сервер или карты уровня H100 с 80 ГБ VRAM и NVLink. Ошибка в сторону меньшей видеопамяти обходится дороже, чем в сторону вычислительной мощности: недостаточно быстрая карта просто работает медленнее, а карта с нехваткой VRAM не запустит модель вовсе.

      Если не уверены, какая конфигурация подойдёт под ваши модели и объём задач, опишите сценарий (размер моделей, инференс или обучение, число одновременных пользователей), и мы подберём сервер под конкретную нагрузку в разделе серверов для искусственного интеллекта.

      Совет на практике

      Прежде чем считать вычислительную мощность GPU, посчитайте требуемый объём VRAM с запасом 20-30% сверх «сухого» размера весов модели: контекст, KV-кэш и служебные буферы съедают память быстрее, чем кажется на старте. Карта, которая впритык вмещает модель без контекста, на практике окажется бесполезной уже при первом длинном диалоге.

      Частые ошибки при выборе GPU-сервера для нейросетей

      • Выбирают GPU по производительности (TFLOPS), забыв, что модель, которая физически не помещается в VRAM карты, не запустится вообще, независимо от скорости вычислений.
      • Планируют дообучение модели по тем же требованиям к VRAM, что и инференс, хотя обучение требует в 4-6 раз больше памяти из-за градиентов, состояний оптимизатора и активаций.
      • Собирают мульти-GPU сервер на потребительских картах через обычный PCIe и ожидают такой же прирост скорости обучения, как на связке с NVLink, хотя интерконнект здесь становится узким местом.
      • Экономят на системной ОЗУ и NVMe-накопителях под датасеты, в результате дорогой GPU простаивает в ожидании данных с медленного диска или скромного объёма памяти при offloading.

      Частые вопросы

      Хватит ли одной карты с 24 ГБ VRAM для локального запуска LLM?
      Для инференса моделей 7-13B в квантованном виде одной карты с 24 ГБ вполне достаточно, и остаётся запас под контекст. Для моделей от 30B и выше уже потребуется либо более агрессивное квантование, либо переход на мульти-GPU конфигурацию.
      Обязательно ли нужен NVLink для дообучения модели?
      Строго обязательным NVLink не является: обучение можно вести и через обычный PCIe-интерконнект между картами. Но при активном обмене промежуточными данными между GPU во время обучения NVLink заметно снижает узкое место скорости обмена, особенно на нескольких картах одновременно.
      Чем LoRA и QLoRA отличаются от полного дообучения по требованиям к железу
      LoRA и QLoRA обучают лишь малую добавочную часть весов модели вместо всех параметров целиком, поэтому требования к VRAM у них в разы ниже полного дообучения. Это позволяет дообучать модели среднего размера даже на одной карте с 24-48 ГБ, где полное дообучение потребовало бы мульти-GPU сервера.
      Что выгоднее для регулярной работы: свой GPU-сервер или аренда в облаке?
      Для разовых экспериментов и пиковых нагрузок аренда GPU в облаке удобнее, поскольку не требует вложений заранее. При постоянной нагрузке, особенно с конфиденциальными данными, собственный сервер выгоднее в пересчёте на месяц и снимает риск, что нужный тип GPU закончится у провайдера в нужный момент.

      Что из этого можно купить

      В наличии, с доставкой по России
      Видеокарта NVIDIA H100 80GB HBM3 PCIe 5.0 OEM для серверов, ИИ и машинного обучения
      Видеокарта NVIDIA H100 80GB HBM3 PCIe 5.0 OEM для серверов, ИИ и машинного обучения
      Доставка (от 4 дней)
      2 890 000 ₽Цена может меняться, уточняйте перед оплатой.!Для видеокарт актуальные цена, наличие и срок поставки рекомендуем дополнительно уточнять у менеджера перед оплатой: рынок и условия поставки меняются быстро.
      В наличии
      Видеокарта NVIDIA A100 96GB HBM2e PCIe 4.0 OEM для серверов, ИИ и машинного обучения
      Видеокарта NVIDIA A100 96GB HBM2e PCIe 4.0 OEM для серверов, ИИ и машинного обучения
      Доставка (от 4 дней)
      2 407 000 ₽Цена может меняться, уточняйте перед оплатой.!Для видеокарт актуальные цена, наличие и срок поставки рекомендуем дополнительно уточнять у менеджера перед оплатой: рынок и условия поставки меняются быстро.
      В наличии
      Видеокарта NVIDIA A100 80GB HBM2e PCIe 4.0 OEM для серверов, ИИ и машинного обучения
      Видеокарта NVIDIA A100 80GB HBM2e PCIe 4.0 OEM для серверов, ИИ и машинного обучения
      Доставка (от 4 дней)
      2 100 000 ₽Цена может меняться, уточняйте перед оплатой.!Для видеокарт актуальные цена, наличие и срок поставки рекомендуем дополнительно уточнять у менеджера перед оплатой: рынок и условия поставки меняются быстро.
      В наличии
      Видеокарта NVIDIA A100 40GB HBM2e PCIe 4.0 OEM для серверов, ИИ и машинного обучения
      Видеокарта NVIDIA A100 40GB HBM2e PCIe 4.0 OEM для серверов, ИИ и машинного обучения
      Доставка (от 4 дней)
      810 000 ₽Цена может меняться, уточняйте перед оплатой.!Для видеокарт актуальные цена, наличие и срок поставки рекомендуем дополнительно уточнять у менеджера перед оплатой: рынок и условия поставки меняются быстро.
      В наличии
      Вся категория «Видеокарты» →Подобрать процессор и память под вашу плату →
      Автор статьи
      Поделиться:
      Корзина
      Вход

      Нет аккаунта?

      Сайдбар
      Магазин
      Избранное
      0 пунктов Заказ
      Мой аккаунт
      ×
      Сообщество HUANANZHI
      Присоединяйтесь к Telegram-чату! Советы по сборке, помощь от владельцев комплектующих и свежие новости бренда.
      Вступить в чат