Сервер с восемью ускорителями и 640 ГБ видеопамяти выглядит как покупка для исследовательской лаборатории. Но у компании для него могут найтись вполне прикладные задачи: поиск по внутренним документам, помощь разработчикам, разбор записей встреч, обработка сканов и выполнение больших очередей запросов без обязательной передачи данных внешнему ИИ-сервису.

Поводом для этой статьи стал ролик ServerFlow от 17 февраля 2026 года. Автор показывает сборку с восемью NVIDIA A100 по 80 ГБ, двумя AMD EPYC 9354, 768 ГБ DDR5 и четырьмя блоками питания по 1600 Вт. Названные в видео 15 млн рублей — оценка автора на момент публикации, не актуальное предложение AI Office. ServerFlow · What can you do with 640 GB of GPU memory?

Разберём, какие модели можно рассматривать для такого узла, как превратить вычисления в полезные рабочие процессы и где заканчиваются возможности одной серверной коробки. Характеристики и карточки моделей проверены 12 сентября 2026 года. Замеры именно этой сборки мы не проводили.

Что компания получает вместе с 640 ГБ видеопамяти

Видеопамять нужна прежде всего для размещения модели и данных её текущих вычислений. Большой объём позволяет выбирать более крупные модели, оставлять место под длинные запросы либо держать несколько независимых сервисов. Эти варианты конкурируют за одни и те же ресурсы: максимальная модель и максимальное количество одновременных пользователей не достигаются автоматически вместе.

Оперативная память сервера решает другие задачи: подготовка документов, загрузка весов, работа баз данных и программ. По данным AMD, EPYC 9354 имеет 32 ядра и поддерживает DDR5; два таких процессора дают заявленные 64 физических ядра. Но 768 ГБ ОЗУ нельзя считать дополнительными 768 ГБ быстрой видеопамяти. Перенос вычислений или части весов на CPU меняет производительность. AMD · EPYC 9354 specifications

Накопители также остаются отдельной частью проекта. На них хранят исходные файлы, индексы, модели разных версий, результаты и резервные копии. Объём архива в терабайтах не означает, что весь архив одновременно находится в контексте нейросети или будет обработан за заранее известное время.

Есть и принципиальная деталь: это восемь отдельных GPU по 80 ГБ. Чтобы одна модель использовала несколько ускорителей, её нужно распределить между ними средствами сервера инференса — программы, которая выполняет запросы к модели. Документация vLLM описывает разные способы такого распределения; выбор зависит в том числе от межсоединений GPU. vLLM · Parallelism and Scaling

Наличие восьми A100 само по себе не подтверждает наличие общей высокоскоростной коммутации между всеми картами. Для покупки нужны точная модификация ускорителей, схема PCIe, сведения об NVLink/NVSwitch и результаты испытаний. Короткое видео не заменяет эту спецификацию.

Почему это не просто «20 RTX 5090»

У RTX 5090 официально указаны 32 ГБ памяти. Поэтому арифметика 20 × 32 = 640 действительно совпадает с заявленным суммарным объёмом восьми A100. Это сравнение ёмкости, из которого нельзя вывести равную скорость моделей. NVIDIA · GeForce RTX 5090 specifications

Для A100 80 ГБ NVIDIA указывает разные характеристики PCIe- и SXM-версий: пропускную способность памяти 1935 и 2039 ГБ/с, а максимальный TDP — 300 и 400 Вт соответственно. NVIDIA · A100 80GB specifications

Сравнение энергопотребления из ролика тоже требует оговорок. По паспортным значениям 20 RTX 5090 по 575 Вт дают 11,5 кВт, а восемь A100 PCIe по 300 Вт — 2,4 кВт. Отношение близко к пяти, но это сумма показателей ускорителей, а не измерение двух серверных систем при выполнении одинаковой задачи. Процессоры, память, вентиляторы, питание и время выполнения в такое сравнение не вошли.

Для бизнеса полезнее другой показатель: сколько стоит обработать тысячу сопоставимых запросов с нужным качеством и задержкой. Его получают испытанием выбранной модели и конфигурации, а не делением гигабайтов или рекламных вычислительных показателей.

Какие языковые модели можно рассматривать

Ниже — конкретные модели с опубликованными весами и документацией, которые помогают понять масштаб возможностей. Это примеры для подбора и испытаний, а не перечень уже проверенных нами установок на сервере из ролика. Состав моделей, формат весов, длину контекста и программную среду фиксируют для каждого внедрения.

Кандидаты для испытаний: возможность размещения не равна подтверждённой производительности
МодельРабочая задачаКак рассматривать размещение
Qwen3-32BТекстовый помощник, ответы и проекты документовОколо 66 ГБ сырых весов BF16. Одна A100 — с проверкой запаса и ограничением контекста; несколько GPU дают больше вариантов.
Qwen3-Coder-30B-A3B-InstructПомощь разработчикам и работа с кодомОколо 61 ГБ весов BF16. Полный заявленный контекст не следует из возможности загрузить веса на одну карту.
Gemma 3 27BТекстовые ответы и понимание изображенийКандидат для части узла; учитывать память обработки изображений и запросов.
Llama 4 ScoutТекст и изображения; проверка языков компанииОколо 218 ГБ весов BF16; распределение по нескольким GPU и отдельный расчёт кэша.
Llama 4 MaverickБолее крупная мультимодальная модельОколо 800 ГБ весов BF16: для полного размещения на GPU нужна подходящая квантованная версия.
DeepSeek-R1 671BСложные текстовые задачи и рассужденияПроект сжатого многокарточного запуска. Оценка 4-битных весов — около 336 ГБ до накладных расходов.

Qwen3-32B содержит 32,8 млрд параметров и подходит как кандидат для текстового помощника. Qwen3-Coder-30B-A3B-Instruct ориентирован на код: в нём 30,5 млрд параметров всего и около 3,3 млрд активных. Такой выбор позволяет начать с задач сотрудников, не занимая весь узел самой большой доступной моделью. Qwen · Qwen3-32B model card Qwen · Qwen3-Coder-30B-A3B-Instruct

Llama 4 Scout и Maverick различаются существенно: около 109 и 400 млрд параметров всего при 17 млрд активных. Обе модели принимают текст и изображения. При этом русский язык не входит в перечисленные Meta официально поддерживаемые языки Llama 4: пригодность для русскоязычных документов необходимо оценивать отдельно. Meta · Llama 4 Scout model card Meta · Llama 4 Maverick model card

В ролике упомянута Gemini. Для самостоятельной установки здесь рассматриваем Gemma — отдельное семейство Google с опубликованными весами. Установка Gemma не создаёт локальную копию Gemini. В частности, Gemma 3 27B принимает текст и изображения и генерирует текстовые ответы. Google · Gemma 3 27B model card

Для любой модели нужно проверить условия её лицензии и предполагаемый способ использования. Возможность скачать веса не означает одинаковых правил для всех семейств, всех стран и всех способов распространения продукта. В эту статью не заложено обещание работы без каких-либо ограничений.

Поместится ли полный DeepSeek

Слово DeepSeek обозначает семейство и несколько существенно разных моделей. Для конкретного примера возьмём DeepSeek-R1 на 671 млрд параметров, из которых около 37 млрд активируются при обработке токена. Опубликованы также уменьшенные distilled-модели; запуск варианта на 32B нельзя представлять как запуск полной 671B-модели. DeepSeek · DeepSeek-R1 model card

Архитектура MoE, или смесь экспертов, уменьшает объём активных вычислений, но не превращает все веса в компактную модель на 37B. При размещении целиком в памяти нужно учитывать полный набор параметров. Если часть экспертов выгружается в ОЗУ, возникают дополнительные требования к обмену и задержкам.

Для первого приближения размер весов считают так: число параметров × количество бит на параметр / 8. В таблице используются десятичные ГБ, то есть миллиарды байтов. Это арифметическая оценка полезной нагрузки весов, не размер готового файла и не потребление памяти работающим сервисом.

Расчёт только сырых весов: десятичные ГБ, без кэша, буферов и метаданных квантования
Число параметров16 бит8 бит4 бита
32,8 млрд65,6 ГБ32,8 ГБ16,4 ГБ
109 млрд218 ГБ109 ГБ54,5 ГБ
400 млрд800 ГБ400 ГБ200 ГБ
671 млрд1342 ГБ671 ГБ335,5 ГБ

Помимо весов нужен KV-кэш — память промежуточных данных, используемых при продолжении ответа. Его расход зависит от архитектуры модели, длины запросов и количества одновременных диалогов. Поэтому модель, которая загрузилась, ещё не считается готовым сервисом для всей компании.

Полный DeepSeek-R1 в 16-битном представлении требует около 1,34 ТБ только под веса и целиком в 640 ГБ видеопамяти не помещается. Оценка для 4 бит — около 336 ГБ — делает такую конфигурацию кандидатом для дальнейшей проверки. К ней добавятся служебные данные квантования, буферы и память запросов. Для 8 бит запас особенно проблематичен: нужно считать реальные байты и доступную память, учитывая различие ГБ и ГиБ.

Квантование — уменьшение точности представления весов. Оно экономит память, но требует проверки качества и совместимости. В таблице vLLM для архитектуры Ampere есть поддержка AWQ и GPTQ, тогда как обычный FP8 W8A8 не поддерживается. Отдельные режимы хранения FP8 могут использовать другие вычислительные пути; одной надписи FP8 на файле недостаточно, чтобы обещать запуск и скорость на A100. vLLM · Quantization and supported hardware

Практический вывод: полный DeepSeek в подходящем сжатом формате — возможный инженерный проект. Утверждать его производительность, максимальный контекст или число пользователей по одному объёму памяти нельзя. Перед покупкой нужен тест конкретного checkpoint, формата и движка на выбранных ускорителях.

Помимо чата: документы, звук, изображения и видео

Компания может получить больше пользы от нескольких специализированных моделей, чем от одного тяжёлого собеседника. Например:

  • Qwen3-Embedding-4B переводит тексты в числовые представления для семантического поиска. Это один из компонентов RAG — поиска подходящих фрагментов перед подготовкой ответа. Qwen · Qwen3-Embedding-4B
  • Qwen3-VL-32B-Instruct можно испытать для разбора изображений документов, схем и фотографий. Разработчик заявляет возможности OCR; извлечённые суммы, реквизиты и технические обозначения всё равно нужно проверять. Qwen · Qwen3-VL-32B-Instruct
  • Whisper large-v3 — модель распознавания речи для подготовки расшифровок. Выделение говорящих, протокол встречи и создание поручений требуют дополнительных компонентов. OpenAI · Whisper large-v3 model card
  • FLUX.1-schnell генерирует изображения по тексту. Его можно рассматривать для эскизов и иллюстраций, оценивая качество и правила использования исходных материалов. Black Forest Labs · FLUX.1-schnell
  • Wan2.2 предлагает модели генерации видео. В официальном проекте есть сценарий для I2V-A14B с GPU минимум на 80 ГБ и выгрузкой части данных в ОЗУ, но длительность генерации и возможности параллельной работы зависят от выбранного режима. Wan-Video · Wan2.2 official project

Все эти сервисы не обязаны работать одновременно. Видео, распознавание большого архива и интерактивные ответы конкурируют за GPU. Для предсказуемой работы нужны очереди, приоритеты и расписание тяжёлых задач. Обработка кадров моделью также не равна точному инженерному измерению или автоматическому подтверждению качества работ.

Что это может дать компании на практике

Первый сценарий — внутренняя база знаний. Сотрудник спрашивает, какие требования действуют для объекта или чем отличаются две версии договора. Система находит разрешённые ему источники, показывает основания и готовит ответ. Польза определяется скоростью поиска и точностью ссылок; сама по себе крупная модель не исправляет устаревшие документы и неправильные права доступа.

Второй — подготовка коммерческих документов. Из заявки можно извлечь позиции, сопоставить их с каталогом и подготовить проект предложения. Цены, скидки и итоговые суммы должна считать программа по утверждённым правилам. Человек проверяет результат перед отправкой. Цель — сократить повторный ввод и время подготовки, сохранив контроль над обязательствами компании.

Третий — помощь собственной ИТ-команде. Локальная модель может объяснять код, предлагать изменения и тесты, помогать разбирать журналы ошибок. Репозитории остаются в выбранной инфраструктуре, но предложения проходят обычную проверку: запуск тестов, ревью и ограничение доступа к рабочим системам.

Четвёртый — работа с накопленным архивом. Ночью можно ставить в очередь разрешённые записи встреч, сканы и техническую документацию, чтобы утром получить подготовленные расшифровки и материалы для поиска. Скорость такого процесса измеряют в страницах, минутах аудио или документах заданного типа, а не в абстрактных «терабайтах ИИ».

Для строительства и эксплуатации это может быть разбор отчётов с объекта, поиск инструкций и подготовка сводки замечаний. В концепции AI Office Field подобные возможности связываются с заданиями и приёмкой. Сервер обеспечивает вычисления, а правила проверки результата и сам отраслевой модуль остаются отдельной работой по внедрению.

Один большой помощник или несколько независимых сервисов

Узел можно настроить под одну крупную модель, распределённую между GPU, либо под несколько меньших моделей и их копий. Второй подход позволяет обслуживать разные процессы, разграничивать нагрузку и обновлять один сервис без одновременной замены остальных.

Например, в испытании можно выделить четыре GPU основной текстовой модели, две — обработке документов, одну — речи и индексации по очереди, одну — экспериментам. Это только пример распределения восьми ускорителей. Если выбранной модели требуется весь узел, такой план не подходит; совместимость и запас памяти проверяют для каждой группы.

Количество сотрудников тоже не равно количеству одновременно выполняемых запросов. Сто пользователей с редкими короткими вопросами и двадцать пользователей, одновременно загрузивших большие договоры, создают разную нагрузку. В испытании нужно фиксировать время до первого ответа, полное время обработки, длину входа и выхода, очередь и частоту ошибок.

Сервер полезен тогда, когда нужный рабочий результат приходит с приемлемой задержкой и проверяемым качеством. Размер модели — лишь один из факторов этого результата.

Можно ли обучить собственную модель

Здесь стоит разделить три задачи. RAG подключает актуальные документы к готовой модели через поиск. Дообучение меняет её поведение на подготовленных примерах. Обучение с нуля создаёт модель на большом наборе данных и требует отдельного расчёта ресурсов.

Для компании на таком узле разумно исследовать LoRA или QLoRA — методы адаптации с обучением относительно небольшого набора дополнительных параметров. Документация PEFT описывает сочетание квантования и LoRA для уменьшения требований к памяти. Но размер обучаемой модели, длина примеров, число шагов и доступное время по-прежнему ограничивают проект. Hugging Face PEFT · Quantization

Из возможности разместить 671B-модель для ответов не следует возможность полноценно обучать все её параметры на той же машине. При обучении нужна дополнительная память для градиентов, состояний оптимизатора и промежуточных вычислений. Актуальные цены и меняющиеся регламенты обычно полезнее хранить в управляемой базе, чем постоянно встраивать их в веса.

Где разместить сервер и сколько стоит его работа

Это оборудование для подготовленной серверной или подходящего дата-центра. Электропитание, охлаждение, шум, масса, глубина стойки, сеть и обслуживание входят в проект наравне с GPU. Четыре блока питания по 1600 Вт не означают постоянное потребление 6,4 кВт; допустимая нагрузка при отказе блока зависит от схемы резервирования.

Энергозатраты считают по замерам всей системы. Условный пример: средняя потребляемая мощность 3,5 кВт × 24 часа × 30 дней = 2520 кВт·ч в месяц, без отдельного учёта охлаждения помещения. Это не измерение сборки из ролика. Итоговая сумма зависит от тарифа и условий размещения.

К стоимости владения добавляются поддержка, резервное копирование, хранение данных, обновления, запасные компоненты и время инженеров. Один узел с резервными блоками питания всё ещё может остановиться из-за другой неисправности. Если процессы компании зависят от ИИ, нужно определить допустимый простой и проверить восстановление либо запасной маршрут выполнения задач.

Локальный запуск позволяет сократить обязательные обращения к внешним AI API. Однако автономность требует заранее подготовленных весов, библиотек и локальных источников. Телеметрия, облачные интеграции и внешние инструменты проверяются отдельно. Защита данных зависит от прав, сети, журналирования и резервных копий, а не только от места установки модели.

Как такой узел может использовать AI Office

Для AI Office подобный сервер — возможный вычислительный слой: на нём работают модели, а платформа управляет документами, заданиями, разрешениями и согласованиями. Большая модель может помогать анализу, меньшая — быстро выполнять типовую операцию. Конкретные маршруты и нагрузку нужно проектировать под компанию.

В текущем прототипе есть подключение Ollama и совместимого HTTP-провайдера, поиск по разрешённым источникам, задачи и подтверждение действий. Но работа на сервере 8 × A100 не установлена и не проверена. Из наличия HTTP-подключения нельзя сделать вывод о готовой поддержке всех моделей, многопользовательской производительности или высокой доступности.

OCR, обработка аудио и видео, а также интеграции с почтой, CRM и учётными системами требуют отдельной реализации и проверки. Поэтому разговор о таком оборудовании начинается с процесса: какие данные поступают, какой результат нужен, кто его подтверждает и какая задержка допустима.

Когда покупка имеет смысл

Сервер такого класса стоит рассматривать, если компания имеет постоянный поток задач, обоснованную потребность в крупных моделях или нескольких сервисах и ресурс на эксплуатацию. Для нескольких сотрудников с редкими запросами сначала полезно проверить меньший узел или аренду сопоставимой конфигурации. Простой дорогих ускорителей тоже входит в стоимость решения.

Первый шаг — выбрать два-три процесса и подготовить примеры реальных задач. Затем сравнить подходящие модели по качеству, задержке и памяти; проверить одновременные запросы, длинные документы и восстановление после отказа. Производительность нужно оценивать в том режиме, в котором системой будут пользоваться сотрудники.

Потенциальный эффект можно выразить через высвобождённое время. Если 80 сотрудников экономят по 15 минут в течение 22 рабочих дней, получается 440 часов в месяц. Это условный расчёт, который должен подтвердиться пилотом с учётом проверки ответов и исправления ошибок. Высвобождённые часы не превращаются автоматически в сокращение зарплатных расходов.

Восемь A100 дают компании широкий выбор локальных моделей и способ распределять вычисления между задачами. Реальную ценность создают подготовленные данные, работающий процесс и измеримый результат. В AI Office мы предлагаем начинать с их разбора: выбрать пилот, проверить модели и только затем определить, нужен ли компании узел на 640 ГБ или более компактная конфигурация.