Вернуться к экспертизе

Как выбрать сервер для локальной языковой модели

Сервер для ИИ нельзя выбирать только по числу параметров модели. Рабочая конфигурация начинается со сценария: кто будет пользоваться системой, какие документы попадут в контур, какой объём контекста нужен и сколько запросов должно выполняться одновременно.

К
Команда ИИ и инфраструктуры ВирТЭКАрхитектура вычислительных платформ

Начинайте не с видеокарты, а с нагрузки

Фраза «нужен сервер для модели 14B» описывает лишь небольшую часть задачи. Одна и та же модель может обслуживать одного инженера, внутренний поиск по документам или десятки сотрудников через корпоративного ассистента. В этих сценариях различаются требования к задержке, количеству одновременных сессий, длине контекста и доступности.

Перед подбором оборудования мы фиксируем четыре параметра:

  • назначение системы: чат, поиск по базе знаний, обработка документов, генерация кода или пакетный анализ;
  • количество активных пользователей и ожидаемый пик параллельных запросов;
  • тип и точность модели, допустимость квантования;
  • целевое время первого ответа и общая скорость генерации.

Видеопамять определяет, что вообще поместится

В GPU должны разместиться веса модели, служебные буферы и KV-кеш, размер которого растёт вместе с контекстом и числом одновременных сессий. Поэтому расчёт «объём файла модели плюс небольшой запас» почти всегда слишком оптимистичен. Длинные документы и параллельные диалоги способны занять заметную часть памяти даже при неизменных весах.

Квантование снижает требования к видеопамяти, но может повлиять на качество и скорость. Решение принимают после испытаний на реальных запросах компании, а не по одному публичному тесту. Если система должна работать с несколькими моделями, учитывать нужно не только их суммарный размер, но и порядок загрузки, возможность выгрузки и требования к времени переключения.

CPU, RAM и накопители не являются второстепенными

Процессор готовит данные, обслуживает API, выполняет токенизацию и поддерживает соседние сервисы. Оперативная память нужна для самой ОС, контейнеров, векторной базы, кеша документов и временного размещения моделей. Для производственного узла разумно оставлять резерв: система не должна входить в своп при первом же пике.

Локальный NVMe влияет на загрузку моделей, индексацию и обработку больших массивов документов. Для RAG отдельно оценивают объём исходных файлов, индексов, резервных копий и журналов. Один быстрый диск без отказоустойчивости подходит для стенда, но не для сервиса, от которого зависит работа подразделения.

Топология важнее количества слотов

В многопроцессорном сервере GPU должны быть сбалансированы по CPU-сокетам и PCIe-корням. Для нескольких ускорителей проверяют число полноскоростных линий, расстояние между GPU, NIC и NVMe, а также поддержку межсоединений. Формально установить восемь карт недостаточно: при неверной топологии часть производительности теряется на перемещении данных.

Не менее важны питание и охлаждение. Ускорители создают высокую постоянную нагрузку, поэтому заранее проверяют мощность блоков питания, резервирование, допустимую температуру воздуха, направление потока и возможности стойки.

Производительность подтверждает пилот

Финальную конфигурацию выбирают по результатам короткого нагрузочного испытания. В пилоте измеряют время первого токена, скорость генерации, число одновременных сессий, загрузку GPU, расход памяти и стабильность при длинном контексте. Это позволяет отличить красивую спецификацию от платформы, которая действительно выдержит рабочий режим.

Практичный путь — начать с измеряемого профиля нагрузки, предусмотреть рост и не покупать максимальную конфигурацию без необходимости. Архитектура должна позволять добавить ускорители или второй узел без полной замены платформы.

Нужна архитектура
под вашу задачу?

Разберём исходные данные, риски и ограничения, затем предложим обоснованный вариант решения.

Обсудить с инженером