Вопрос «сколько сотрудников сможет работать одновременно» нельзя решить только по объёму памяти. Один пользователь может отправить короткий вопрос, другой — большой документ, третий — запись встречи. Для станции это разные задания с разным временем исполнения и расходом ресурсов.
Отличайте пользователей от активных вычислений
В компании может быть много зарегистрированных сотрудников, но лишь часть обращается к модели в один момент. Кроме того, поиск, распознавание и генерация не обязаны выполняться одной моделью. Полезно разделить интерактивные запросы и фоновые операции ещё до выбора оборудования.
Документация Ollama отмечает связь потребления памяти с параллельными запросами и длиной контекста. Это одна из причин проверять рабочую нагрузку на конкретной среде запуска вместо расчёта по одной характеристике мини-ПК. Ollama · FAQ ↗
Пример: утро отдела продаж
Несколько менеджеров одновременно готовят ответы, а в фоне индексируется архив. Без правил фоновые операции могут ухудшить ожидание в интерфейсе. В предлагаемой схеме короткие рабочие запросы получают отдельную очередь, а большой импорт ограничивается по ресурсам или переносится на другое время.
Очередь должна быть видимой: пользователь понимает, что запрос принят, может отменить его и не создаёт копии многократным нажатием. При отказе задания система объясняет причину и сохраняет возможность повторить его без дублирования результата.
Как составить нагрузочную проверку
- Возьмите короткие, средние и самые тяжёлые типовые задания. - Задайте реалистичное число одновременных активных запросов. - Замерьте время до начала ответа и до готового документа. - Повторите испытание вместе с индексацией и резервным копированием.
Что менять по результатам
Если качество хорошее, но ожидание слишком долгое, рассмотрите меньшую модель, сокращение лишнего контекста или расписание фоновой обработки. Если ошибки связаны с источниками, более мощное железо их не исправит. Расширение станции имеет смысл после определения узкого места. В AI Office роли можно добавлять по мере проверки нагрузки, не обещая одновременную работу всех возможных сценариев.