Сервер с восемью ускорителями и 640 ГБ видеопамяти выглядит как покупка для исследовательской лаборатории. Но у компании для него могут найтись вполне прикладные задачи: поиск по внутренним документам, помощь разработчикам, разбор записей встреч, обработка сканов и выполнение больших очередей запросов без обязательной передачи данных внешнему ИИ-сервису.
Поводом для этой статьи стал ролик ServerFlow от 17 февраля 2026 года. Автор показывает сборку с восемью NVIDIA A100 по 80 ГБ, двумя AMD EPYC 9354, 768 ГБ DDR5 и четырьмя блоками питания по 1600 Вт. Названные в видео 15 млн рублей — оценка автора на момент публикации, не актуальное предложение AI Office. ServerFlow · What can you do with 640 GB of GPU memory? ↗
Разберём, какие модели можно рассматривать для такого узла, как превратить вычисления в полезные рабочие процессы и где заканчиваются возможности одной серверной коробки. Характеристики и карточки моделей проверены 12 сентября 2026 года. Замеры именно этой сборки мы не проводили.
Что компания получает вместе с 640 ГБ видеопамяти
Видеопамять нужна прежде всего для размещения модели и данных её текущих вычислений. Большой объём позволяет выбирать более крупные модели, оставлять место под длинные запросы либо держать несколько независимых сервисов. Эти варианты конкурируют за одни и те же ресурсы: максимальная модель и максимальное количество одновременных пользователей не достигаются автоматически вместе.
Оперативная память сервера решает другие задачи: подготовка документов, загрузка весов, работа баз данных и программ. По данным AMD, EPYC 9354 имеет 32 ядра и поддерживает DDR5; два таких процессора дают заявленные 64 физических ядра. Но 768 ГБ ОЗУ нельзя считать дополнительными 768 ГБ быстрой видеопамяти. Перенос вычислений или части весов на CPU меняет производительность. AMD · EPYC 9354 specifications ↗
Накопители также остаются отдельной частью проекта. На них хранят исходные файлы, индексы, модели разных версий, результаты и резервные копии. Объём архива в терабайтах не означает, что весь архив одновременно находится в контексте нейросети или будет обработан за заранее известное время.
Есть и принципиальная деталь: это восемь отдельных GPU по 80 ГБ. Чтобы одна модель использовала несколько ускорителей, её нужно распределить между ними средствами сервера инференса — программы, которая выполняет запросы к модели. Документация vLLM описывает разные способы такого распределения; выбор зависит в том числе от межсоединений GPU. vLLM · Parallelism and Scaling ↗
Наличие восьми A100 само по себе не подтверждает наличие общей высокоскоростной коммутации между всеми картами. Для покупки нужны точная модификация ускорителей, схема PCIe, сведения об NVLink/NVSwitch и результаты испытаний. Короткое видео не заменяет эту спецификацию.
Почему это не просто «20 RTX 5090»
У RTX 5090 официально указаны 32 ГБ памяти. Поэтому арифметика 20 × 32 = 640 действительно совпадает с заявленным суммарным объёмом восьми A100. Это сравнение ёмкости, из которого нельзя вывести равную скорость моделей. NVIDIA · GeForce RTX 5090 specifications ↗
Для A100 80 ГБ NVIDIA указывает разные характеристики PCIe- и SXM-версий: пропускную способность памяти 1935 и 2039 ГБ/с, а максимальный TDP — 300 и 400 Вт соответственно. NVIDIA · A100 80GB specifications ↗
Сравнение энергопотребления из ролика тоже требует оговорок. По паспортным значениям 20 RTX 5090 по 575 Вт дают 11,5 кВт, а восемь A100 PCIe по 300 Вт — 2,4 кВт. Отношение близко к пяти, но это сумма показателей ускорителей, а не измерение двух серверных систем при выполнении одинаковой задачи. Процессоры, память, вентиляторы, питание и время выполнения в такое сравнение не вошли.
Для бизнеса полезнее другой показатель: сколько стоит обработать тысячу сопоставимых запросов с нужным качеством и задержкой. Его получают испытанием выбранной модели и конфигурации, а не делением гигабайтов или рекламных вычислительных показателей.
Какие языковые модели можно рассматривать
Ниже — конкретные модели с опубликованными весами и документацией, которые помогают понять масштаб возможностей. Это примеры для подбора и испытаний, а не перечень уже проверенных нами установок на сервере из ролика. Состав моделей, формат весов, длину контекста и программную среду фиксируют для каждого внедрения.
| Модель | Рабочая задача | Как рассматривать размещение |
|---|---|---|
| Qwen3-32B | Текстовый помощник, ответы и проекты документов | Около 66 ГБ сырых весов BF16. Одна A100 — с проверкой запаса и ограничением контекста; несколько GPU дают больше вариантов. |
| Qwen3-Coder-30B-A3B-Instruct | Помощь разработчикам и работа с кодом | Около 61 ГБ весов BF16. Полный заявленный контекст не следует из возможности загрузить веса на одну карту. |
| Gemma 3 27B | Текстовые ответы и понимание изображений | Кандидат для части узла; учитывать память обработки изображений и запросов. |
| Llama 4 Scout | Текст и изображения; проверка языков компании | Около 218 ГБ весов BF16; распределение по нескольким GPU и отдельный расчёт кэша. |
| Llama 4 Maverick | Более крупная мультимодальная модель | Около 800 ГБ весов BF16: для полного размещения на GPU нужна подходящая квантованная версия. |
| DeepSeek-R1 671B | Сложные текстовые задачи и рассуждения | Проект сжатого многокарточного запуска. Оценка 4-битных весов — около 336 ГБ до накладных расходов. |
Qwen3-32B содержит 32,8 млрд параметров и подходит как кандидат для текстового помощника. Qwen3-Coder-30B-A3B-Instruct ориентирован на код: в нём 30,5 млрд параметров всего и около 3,3 млрд активных. Такой выбор позволяет начать с задач сотрудников, не занимая весь узел самой большой доступной моделью. Qwen · Qwen3-32B model card ↗ Qwen · Qwen3-Coder-30B-A3B-Instruct ↗
Llama 4 Scout и Maverick различаются существенно: около 109 и 400 млрд параметров всего при 17 млрд активных. Обе модели принимают текст и изображения. При этом русский язык не входит в перечисленные Meta официально поддерживаемые языки Llama 4: пригодность для русскоязычных документов необходимо оценивать отдельно. Meta · Llama 4 Scout model card ↗ Meta · Llama 4 Maverick model card ↗
В ролике упомянута Gemini. Для самостоятельной установки здесь рассматриваем Gemma — отдельное семейство Google с опубликованными весами. Установка Gemma не создаёт локальную копию Gemini. В частности, Gemma 3 27B принимает текст и изображения и генерирует текстовые ответы. Google · Gemma 3 27B model card ↗
Для любой модели нужно проверить условия её лицензии и предполагаемый способ использования. Возможность скачать веса не означает одинаковых правил для всех семейств, всех стран и всех способов распространения продукта. В эту статью не заложено обещание работы без каких-либо ограничений.
Поместится ли полный DeepSeek
Слово DeepSeek обозначает семейство и несколько существенно разных моделей. Для конкретного примера возьмём DeepSeek-R1 на 671 млрд параметров, из которых около 37 млрд активируются при обработке токена. Опубликованы также уменьшенные distilled-модели; запуск варианта на 32B нельзя представлять как запуск полной 671B-модели. DeepSeek · DeepSeek-R1 model card ↗
Архитектура MoE, или смесь экспертов, уменьшает объём активных вычислений, но не превращает все веса в компактную модель на 37B. При размещении целиком в памяти нужно учитывать полный набор параметров. Если часть экспертов выгружается в ОЗУ, возникают дополнительные требования к обмену и задержкам.
Для первого приближения размер весов считают так: число параметров × количество бит на параметр / 8. В таблице используются десятичные ГБ, то есть миллиарды байтов. Это арифметическая оценка полезной нагрузки весов, не размер готового файла и не потребление памяти работающим сервисом.
| Число параметров | 16 бит | 8 бит | 4 бита |
|---|---|---|---|
| 32,8 млрд | 65,6 ГБ | 32,8 ГБ | 16,4 ГБ |
| 109 млрд | 218 ГБ | 109 ГБ | 54,5 ГБ |
| 400 млрд | 800 ГБ | 400 ГБ | 200 ГБ |
| 671 млрд | 1342 ГБ | 671 ГБ | 335,5 ГБ |
Помимо весов нужен KV-кэш — память промежуточных данных, используемых при продолжении ответа. Его расход зависит от архитектуры модели, длины запросов и количества одновременных диалогов. Поэтому модель, которая загрузилась, ещё не считается готовым сервисом для всей компании.
Полный DeepSeek-R1 в 16-битном представлении требует около 1,34 ТБ только под веса и целиком в 640 ГБ видеопамяти не помещается. Оценка для 4 бит — около 336 ГБ — делает такую конфигурацию кандидатом для дальнейшей проверки. К ней добавятся служебные данные квантования, буферы и память запросов. Для 8 бит запас особенно проблематичен: нужно считать реальные байты и доступную память, учитывая различие ГБ и ГиБ.
Квантование — уменьшение точности представления весов. Оно экономит память, но требует проверки качества и совместимости. В таблице vLLM для архитектуры Ampere есть поддержка AWQ и GPTQ, тогда как обычный FP8 W8A8 не поддерживается. Отдельные режимы хранения FP8 могут использовать другие вычислительные пути; одной надписи FP8 на файле недостаточно, чтобы обещать запуск и скорость на A100. vLLM · Quantization and supported hardware ↗
Практический вывод: полный DeepSeek в подходящем сжатом формате — возможный инженерный проект. Утверждать его производительность, максимальный контекст или число пользователей по одному объёму памяти нельзя. Перед покупкой нужен тест конкретного checkpoint, формата и движка на выбранных ускорителях.
Помимо чата: документы, звук, изображения и видео
Компания может получить больше пользы от нескольких специализированных моделей, чем от одного тяжёлого собеседника. Например:
- Qwen3-Embedding-4B переводит тексты в числовые представления для семантического поиска. Это один из компонентов RAG — поиска подходящих фрагментов перед подготовкой ответа. Qwen · Qwen3-Embedding-4B ↗
- Qwen3-VL-32B-Instruct можно испытать для разбора изображений документов, схем и фотографий. Разработчик заявляет возможности OCR; извлечённые суммы, реквизиты и технические обозначения всё равно нужно проверять. Qwen · Qwen3-VL-32B-Instruct ↗
- Whisper large-v3 — модель распознавания речи для подготовки расшифровок. Выделение говорящих, протокол встречи и создание поручений требуют дополнительных компонентов. OpenAI · Whisper large-v3 model card ↗
- FLUX.1-schnell генерирует изображения по тексту. Его можно рассматривать для эскизов и иллюстраций, оценивая качество и правила использования исходных материалов. Black Forest Labs · FLUX.1-schnell ↗
- Wan2.2 предлагает модели генерации видео. В официальном проекте есть сценарий для I2V-A14B с GPU минимум на 80 ГБ и выгрузкой части данных в ОЗУ, но длительность генерации и возможности параллельной работы зависят от выбранного режима. Wan-Video · Wan2.2 official project ↗
Все эти сервисы не обязаны работать одновременно. Видео, распознавание большого архива и интерактивные ответы конкурируют за GPU. Для предсказуемой работы нужны очереди, приоритеты и расписание тяжёлых задач. Обработка кадров моделью также не равна точному инженерному измерению или автоматическому подтверждению качества работ.
Что это может дать компании на практике
Первый сценарий — внутренняя база знаний. Сотрудник спрашивает, какие требования действуют для объекта или чем отличаются две версии договора. Система находит разрешённые ему источники, показывает основания и готовит ответ. Польза определяется скоростью поиска и точностью ссылок; сама по себе крупная модель не исправляет устаревшие документы и неправильные права доступа.
Второй — подготовка коммерческих документов. Из заявки можно извлечь позиции, сопоставить их с каталогом и подготовить проект предложения. Цены, скидки и итоговые суммы должна считать программа по утверждённым правилам. Человек проверяет результат перед отправкой. Цель — сократить повторный ввод и время подготовки, сохранив контроль над обязательствами компании.
Третий — помощь собственной ИТ-команде. Локальная модель может объяснять код, предлагать изменения и тесты, помогать разбирать журналы ошибок. Репозитории остаются в выбранной инфраструктуре, но предложения проходят обычную проверку: запуск тестов, ревью и ограничение доступа к рабочим системам.
Четвёртый — работа с накопленным архивом. Ночью можно ставить в очередь разрешённые записи встреч, сканы и техническую документацию, чтобы утром получить подготовленные расшифровки и материалы для поиска. Скорость такого процесса измеряют в страницах, минутах аудио или документах заданного типа, а не в абстрактных «терабайтах ИИ».
Для строительства и эксплуатации это может быть разбор отчётов с объекта, поиск инструкций и подготовка сводки замечаний. В концепции AI Office Field подобные возможности связываются с заданиями и приёмкой. Сервер обеспечивает вычисления, а правила проверки результата и сам отраслевой модуль остаются отдельной работой по внедрению.
Один большой помощник или несколько независимых сервисов
Узел можно настроить под одну крупную модель, распределённую между GPU, либо под несколько меньших моделей и их копий. Второй подход позволяет обслуживать разные процессы, разграничивать нагрузку и обновлять один сервис без одновременной замены остальных.
Например, в испытании можно выделить четыре GPU основной текстовой модели, две — обработке документов, одну — речи и индексации по очереди, одну — экспериментам. Это только пример распределения восьми ускорителей. Если выбранной модели требуется весь узел, такой план не подходит; совместимость и запас памяти проверяют для каждой группы.
Количество сотрудников тоже не равно количеству одновременно выполняемых запросов. Сто пользователей с редкими короткими вопросами и двадцать пользователей, одновременно загрузивших большие договоры, создают разную нагрузку. В испытании нужно фиксировать время до первого ответа, полное время обработки, длину входа и выхода, очередь и частоту ошибок.
Сервер полезен тогда, когда нужный рабочий результат приходит с приемлемой задержкой и проверяемым качеством. Размер модели — лишь один из факторов этого результата.
Можно ли обучить собственную модель
Здесь стоит разделить три задачи. RAG подключает актуальные документы к готовой модели через поиск. Дообучение меняет её поведение на подготовленных примерах. Обучение с нуля создаёт модель на большом наборе данных и требует отдельного расчёта ресурсов.
Для компании на таком узле разумно исследовать LoRA или QLoRA — методы адаптации с обучением относительно небольшого набора дополнительных параметров. Документация PEFT описывает сочетание квантования и LoRA для уменьшения требований к памяти. Но размер обучаемой модели, длина примеров, число шагов и доступное время по-прежнему ограничивают проект. Hugging Face PEFT · Quantization ↗
Из возможности разместить 671B-модель для ответов не следует возможность полноценно обучать все её параметры на той же машине. При обучении нужна дополнительная память для градиентов, состояний оптимизатора и промежуточных вычислений. Актуальные цены и меняющиеся регламенты обычно полезнее хранить в управляемой базе, чем постоянно встраивать их в веса.
Где разместить сервер и сколько стоит его работа
Это оборудование для подготовленной серверной или подходящего дата-центра. Электропитание, охлаждение, шум, масса, глубина стойки, сеть и обслуживание входят в проект наравне с GPU. Четыре блока питания по 1600 Вт не означают постоянное потребление 6,4 кВт; допустимая нагрузка при отказе блока зависит от схемы резервирования.
Энергозатраты считают по замерам всей системы. Условный пример: средняя потребляемая мощность 3,5 кВт × 24 часа × 30 дней = 2520 кВт·ч в месяц, без отдельного учёта охлаждения помещения. Это не измерение сборки из ролика. Итоговая сумма зависит от тарифа и условий размещения.
К стоимости владения добавляются поддержка, резервное копирование, хранение данных, обновления, запасные компоненты и время инженеров. Один узел с резервными блоками питания всё ещё может остановиться из-за другой неисправности. Если процессы компании зависят от ИИ, нужно определить допустимый простой и проверить восстановление либо запасной маршрут выполнения задач.
Локальный запуск позволяет сократить обязательные обращения к внешним AI API. Однако автономность требует заранее подготовленных весов, библиотек и локальных источников. Телеметрия, облачные интеграции и внешние инструменты проверяются отдельно. Защита данных зависит от прав, сети, журналирования и резервных копий, а не только от места установки модели.
Как такой узел может использовать AI Office
Для AI Office подобный сервер — возможный вычислительный слой: на нём работают модели, а платформа управляет документами, заданиями, разрешениями и согласованиями. Большая модель может помогать анализу, меньшая — быстро выполнять типовую операцию. Конкретные маршруты и нагрузку нужно проектировать под компанию.
В текущем прототипе есть подключение Ollama и совместимого HTTP-провайдера, поиск по разрешённым источникам, задачи и подтверждение действий. Но работа на сервере 8 × A100 не установлена и не проверена. Из наличия HTTP-подключения нельзя сделать вывод о готовой поддержке всех моделей, многопользовательской производительности или высокой доступности.
OCR, обработка аудио и видео, а также интеграции с почтой, CRM и учётными системами требуют отдельной реализации и проверки. Поэтому разговор о таком оборудовании начинается с процесса: какие данные поступают, какой результат нужен, кто его подтверждает и какая задержка допустима.
Когда покупка имеет смысл
Сервер такого класса стоит рассматривать, если компания имеет постоянный поток задач, обоснованную потребность в крупных моделях или нескольких сервисах и ресурс на эксплуатацию. Для нескольких сотрудников с редкими запросами сначала полезно проверить меньший узел или аренду сопоставимой конфигурации. Простой дорогих ускорителей тоже входит в стоимость решения.
Первый шаг — выбрать два-три процесса и подготовить примеры реальных задач. Затем сравнить подходящие модели по качеству, задержке и памяти; проверить одновременные запросы, длинные документы и восстановление после отказа. Производительность нужно оценивать в том режиме, в котором системой будут пользоваться сотрудники.
Потенциальный эффект можно выразить через высвобождённое время. Если 80 сотрудников экономят по 15 минут в течение 22 рабочих дней, получается 440 часов в месяц. Это условный расчёт, который должен подтвердиться пилотом с учётом проверки ответов и исправления ошибок. Высвобождённые часы не превращаются автоматически в сокращение зарплатных расходов.
Восемь A100 дают компании широкий выбор локальных моделей и способ распределять вычисления между задачами. Реальную ценность создают подготовленные данные, работающий процесс и измеримый результат. В AI Office мы предлагаем начинать с их разбора: выбрать пилот, проверить модели и только затем определить, нужен ли компании узел на 640 ГБ или более компактная конфигурация.
