«Зачем покупать локальную AI-станцию, если облачный API стоит несколько долларов за миллион токенов?» Вопрос разумный. Но в нём сравниваются разные вещи: цена вычислителя и тариф на небольшую часть работы. Чтобы выбрать между локальным ИИ и облаком, нужно посчитать весь процесс — от получения задания до результата, который компания готова принять.
Бизнесу важна цена корректно обработанного обращения или проверенного документа. Разберём её на текущих тарифах и горизонте 12–24 месяцев. Все расчёты ниже — сценарии, а не результаты внедрения у клиента.
Правильная единица — успешно выполненная задача
Допустим, агент получил письмо, нашёл договор, посмотрел CRM, проверил прайс и подготовил ответ. Для бизнеса это одна задача. Для модели — несколько обращений, каждое со своим входным контекстом, ответом и, возможно, использованием инструментов.
Считать нужно стоимость успешно выполненной бизнес-задачи, а не только цену токена.
За период стоимость принятого результата равна всем затратам на процесс, делённым на число результатов, прошедших проверку. В числителе остаются и неудачные попытки, и повторные вызовы, и ручные исправления. Например, если 100 запусков обошлись в $16, а принято 80 результатов, только API-часть стоимости успешной задачи составляет $0,20, а не $0,16.
Заранее определите критерии успеха: правильные реквизиты, актуальный прайс, источники и время ответа. Если результат одной модели постоянно исправляет сотрудник, сравнение одних API-счетов скроет эти расходы.
Почему один и тот же запрос расходует разный бюджет
Текст разбивается на токены по правилам конкретной модели. Кроме токенизации меняются длина ответа, объём внутренних рассуждений и количество шагов. Поэтому одинаковое письмо не гарантирует одинакового расхода у разных моделей, а короткий видимый ответ не означает маленький счёт.
Для каждого вызова токенная часть считается так: некэшированный вход × его тариф + кэшированный вход × его тариф + оплачиваемый выход × его тариф. Цены за миллион требуют деления каждого количества токенов на 1 000 000. Затем расходы складываются по всем вызовам процесса.
У OpenAI reasoning-токены оплачиваются как выходные. Если они уже входят в показанный API объём output, прибавлять их второй раз нельзя. Повторный запрос тоже не отдельная мистическая наценка: это ещё один вызов с собственным расходом. OpenAI · Reasoning models ↗
Сверху могут добавляться услуги инструментов. Например, веб-поиск OpenAI стоит $10 за 1000 вызовов плюс оплата поискового контекста по правилам тарифа. Один такой вызов в каждом из 6600 процессов — ещё $66 в месяц до учёта контекста. При этом обычный вызов вашей CRM не обязательно имеет отдельную плату поставщику модели: стоимость зависит от конкретного инструмента и интеграции. OpenAI · API pricing ↗
Агентная цепочка: почему бюджет накапливается
Когда агент продолжает работу, результаты предыдущих действий часто становятся входом следующего запроса. Представим четыре шага с входом 10, 18, 27 и 39 тысяч токенов. Суммарно обработано 94 тысячи входных токенов, хотя последний контекст содержал 39 тысяч. Это арифметическая иллюстрация, не замер типового бизнес-процесса.
Повторное чтение и передача истории увеличивают расход. Рост не обязан быть экспоненциальным: он зависит от шагов и управления контекстом. Кэширование, выборочные выдержки, сжатие истории и остановка бесполезных повторов меняют экономику.
В исследовании Bai и соавторов 2026 года изучались восемь моделей в OpenHands на SWE-bench Verified. Каждая задача запускалась четырежды; полная история переносилась в следующие шаги. Авторы сообщают о различиях расхода до 30 раз между прогонами одной задачи и показывают, что дополнительные токены не гарантируют более высокую точность. Bai et al. · How Do AI Agents Spend Your Money? ↗
Это исследование программирования, а не обработки счетов или писем. Его коэффициенты нельзя автоматически переносить на CRM. Практический вывод другой: бюджет многошагового агента нужно измерять целиком и несколько раз. Один удачный демонстрационный запуск не показывает ни типичную стоимость, ни дорогие отклонения.
Сколько стоит условный процесс по текущим тарифам
Возьмём общий бюджет одного запуска: 30 000 некэшированных входных и 2000 оплачиваемых выходных токенов за все его шаги. В выход уже включены оплачиваемые рассуждения, если они есть. Это заданный объём для сравнения тарифов, а не обещание, что разные модели выполнят работу одинаково или уложатся в него.
Тарифы проверены 8 сентября 2026 года. Для GPT-5.6 Sol используем обычный тариф $4/$20 за миллион входных/выходных токенов. Для Qwen3.8-Max — базовые $1,65/$4,951 в регионе Global, Germany (Frankfurt), без временных акций; в Singapore International опубликованы другие цены — $2/$6. Для DeepSeek V4 Flash — пиковые $0,44/$1,32 при промахе кэша. OpenAI · GPT-5.6 Sol ↗ Alibaba Cloud · Qwen3.8-Max pricing ↗ DeepSeek · Models & Pricing ↗
| Модель | Вход $/1 млн | Выход $/1 млн | Запуск, $ | Месяц, $ | Год, $ |
|---|---|---|---|---|---|
| GPT-5.6 Sol | 4,00 | 20,00 | 0,16 | 1 056,00 | 12 672,00 |
| Qwen3.8-Max · Frankfurt | 1,65 | 4,951 | 0,059402 | 392,05 | 4 704,64 |
| DeepSeek V4 Flash · peak | 0,44 | 1,32 | 0,01584 | 104,54 | 1 254,53 |
В расчёте нет скидок кэширования, Batch, акций, инструментов, налогов и комиссий оплаты. У DeepSeek вне пикового времени указанные ставки вдвое ниже; опубликованные пиковые окна — 01:00–04:00 и 06:00–10:00 UTC по будням. Реальный счёт зависит от того, когда выполняются запросы. Условия региона, доступность аккаунта и способ оплаты нужно проверять для конкретной компании.
Таблица не ранжирует качество моделей. Qwen3.8-Max здесь — облачный API; это не та же модель, что локальная Qwen меньшего размера. Дешёвый API может оказаться лучшим вариантом, если он стабильно проходит критерии качества. Это нужно проверить, прежде чем обосновывать покупку станции экономией относительно дорогой модели.
Что меняют 100, 300 и 1000 задач в день
Для масштаба примем 22 рабочих дня в месяц. Каждая новая задача имеет тот же условный токенный бюджет; повторы внутри него уже учтены. Если реальный агент повторяет работу сверх бюджета, добавлять следует фактический расход, а не произвольный коэффициент «на всякий случай».
| Модель | 100 задач/день | 300 задач/день | 1000 задач/день |
|---|---|---|---|
| GPT-5.6 Sol | 352,00 | 1 056,00 | 3 520,00 |
| Qwen3.8-Max · Frankfurt | 130,68 | 392,05 | 1 306,84 |
| DeepSeek V4 Flash · peak | 34,85 | 104,54 | 348,48 |
В этой модели 300 ежедневных запусков GPT-5.6 Sol стоят $1056 в месяц только за токены. При DeepSeek V4 Flash в пиковом тарифе — $104,54. Разница почти десятикратная ещё до выбора локального оборудования. Поэтому вывод «при большом количестве задач локальный ИИ всегда выгоднее» был бы слишком сильным.
Измеряйте среднюю стоимость, долю успешных результатов и дорогой хвост — например, 95-й процентиль, ниже которого лежат 95% наблюдений. Ограничивайте число шагов, повторы и бюджет процесса. Иначе редкая задача, застрявшая в цикле, может заметно испортить среднее за день.
Локальный сервер: токенного счётчика нет, расходы остаются
У собственной модели нет отдельного платежа провайдеру за каждый сгенерированный токен. Однако есть оборудование, внедрение, электричество, обслуживание, лицензии, резервные копии, проверка обновлений и время людей. Если вычислитель занят полностью, следующий поток задач потребует очереди или дополнительной мощности.
Условный компьютер за 280 тысяч рублей не равен готовому AI Office. На сайте ориентир аппаратного комплекта — 299 990–349 990 ₽, внедрения трёх сценариев — 500–800 тысяч ₽, сопровождения — 30–100 тысяч ₽ в месяц отдельно. Это предварительные оценки по КП от 5 сентября 2026 года; финальная смета зависит от проекта. Нельзя сравнивать только цену устройства с полным облачным процессом или, наоборот, только API с готовым внедрением.
Электричество тоже лучше считать из измеренной нагрузки. Например, условные средние 200 Вт при круглосуточной работе 30 дней — 144 кВт·ч в месяц. При расчётных 8 ₽/кВт·ч это 1152 ₽. Здесь и мощность, и тариф — допущения, не паспорт станции и не тариф вашего региона. Добавьте необходимые хранилища, сеть и резервирование.
Гибрид: локальная рутина и облако по правилам
Практический вариант — маршрутизатор моделей: типовые задания идут в локальную модель, сложные исключения направляются во внешнюю только при допустимости передачи данных. Кандидаты для пилота — классификация обращений, поиск по RAG, извлечение полей, короткие ответы и подготовка изменений CRM.
OCR, транскрибация, эмбеддинги и ранжирование тоже могут выполняться локально, но требуют собственных моделей и ресурсов. Это не бесплатные способности одной языковой модели. Проверять нужно производительность всего процесса, а не только скорость генерации текста.
Допустим, локальный путь даёт приемлемый результат для 90% задач, а 10% обращаются к GPT-5.6 Sol. Если средний облачный бюджет этих 10% остаётся таким же, токенный счёт уменьшается с $1056 до $105,60. Это условие модели расчёта, а не подтверждённая доля для AI Office.
Сложные исключения могут быть дороже среднего. Если оставшиеся 10% потребляют втрое больше токенов, облачный счёт составит уже $316,80. Также учитываются локальные попытки перед переводом в облако, работа маршрутизатора и ручная проверка. Автоматическая передача конфиденциальных документов ради дешёвого ответа не должна обходить правила компании.
Сравнение затрат за 12 и 24 месяца
Для прозрачного примера зададим две сметы одного набора функций. Облачный вариант: 500 тысяч ₽ запуска и 30 тысяч ₽ ежемесячных расходов помимо API. Гибрид: 800 тысяч ₽ запуска, включая оборудование, и 35 тысяч ₽ ежемесячно помимо API. Эти числа — условные бюджеты, не предложение цены облачного продукта и не новая смета AI Office.
В ежемесячный бюджет предполагается включить обслуживание, инфраструктуру, электричество, копии, лицензии и проверку результатов. В реальном проекте эти статьи раскладываются отдельно. В примере они неизменны, качество и сроки одинаковы, объёма одной станции хватает, а 10% задач идут в облако с прежним средним бюджетом. Не учтены налоги, стоимость финансирования, остаточная стоимость оборудования и денежная оценка рисков.
Пересчёт — по официальному курсу Банка России на 8 сентября 2026 года: 86,1909 ₽ за $1. Это фиксированный курс сценария, не прогноз и не обещание курса фактической оплаты. Объём — 300 задач в день, 22 дня в месяц. Bank of Russia · USD/RUB · 08.09.2026 ↗
| API для сравнения | Облако 12 мес. | Гибрид 12 мес. | Облако 24 мес. | Гибрид 24 мес. |
|---|---|---|---|---|
| GPT-5.6 Sol | 1 952,2 | 1 329,2 | 3 404,4 | 1 858,4 |
| Qwen3.8-Max · Frankfurt | 1 265,5 | 1 260,5 | 2 031,0 | 1 721,1 |
| DeepSeek V4 Flash · peak | 968,1 | 1 230,8 | 1 436,3 | 1 661,6 |
В паре с GPT гибрид в этом сценарии требует на 300 тысяч ₽ больше при запуске, но экономит около 76,9 тысячи ₽ ежемесячно. Пересечение затрат происходит примерно через 3,9 месяца. Для Qwen — через 11,8 месяца. Для дешёвого DeepSeek гибрид не окупает дополнительные вложения ни за год, ни за два.
Это сравнительная окупаемость дополнительных вложений относительно облака, а не доказательство окупаемости автоматизации для бизнеса. Чтобы оценить сам проект, отдельно сравните его затраты с подтверждённой ценностью результата: высвобождённым временем, скоростью обработки или снижением ошибок. Не выдавайте каждую сэкономленную минуту за сокращённые расходы на зарплату.
Когда локальная система не окупается
Срок пересечения затрат равен дополнительным вложениям в локальный вариант, делённым на ежемесячную экономию после всех его дополнительных расходов. Если экономия нулевая или отрицательная, такого срока при заданных условиях нет. «90% меньше API» ещё не означает «90% меньше расходов на ИИ».
При 100 задачах в день и GPT-профиле, сохранив остальные условия, срок увеличивается примерно до 13,4 месяца. При 20 задачах чистая экономия — лишь около 461 ₽ в месяц: дополнительные вложения не возвращаются за 12–24 месяца. При ещё меньшем объёме экономия может стать отрицательной. А 1000 ежедневных задач нельзя автоматически объявить выгодным локальным режимом: сначала нужно доказать, что оборудование выдерживает нагрузку и сроки.
Облако часто подходит для редкой или неравномерной нагрузки, экспериментов и процессов, где стабильно нужна сильная модель. Локальная схема заслуживает проверки при постоянной повторяемой работе и требованиях к контролю данных. Если ограничение на передачу информации обязательно, оно становится условием выбора, а не выдуманной денежной скидкой в расчёте.
Что должен доказать пилот AI Office
Идею AI Office Bench стоит понимать как проверку на задачах конкретной компании. Название само по себе не подтверждает наличие готового измерительного продукта или долю локального покрытия. Для решения о внедрении нужен воспроизводимый набор примеров, критерии приёмки и реальные журналы расхода.
- Сравнить модели на одинаковых документах и критериях: что считается правильным ответом и кто его принимает.
- Измерить полные цепочки, повторы и отказы; отдельно учитывать вход, кэш, выход, инструменты и время ручной проверки.
- Проверить долю задач, действительно завершённых локально, и цену сложных облачных исключений.
- Нагрузить систему с реальной одновременностью: RAG, OCR, модели и CRM могут конкурировать за ресурсы.
- Зафиксировать стоимость успешного результата, время обработки и правила остановки дорогих или небезопасных действий.
Пересчитывайте сравнение раз в квартал и при изменении нагрузки. Новые модели могут улучшить результат на прежнем оборудовании, но требуют проверки совместимости и скорости. Облачные тарифы меняются в обе стороны; будущие улучшения не гарантированы.
Покупать вычисления под работу компании
Облачный ИИ похож на такси: при редких поездках владеть автомобилем необязательно. Когда машина занята каждый день, расчёт меняется — но топливо, обслуживание и возможности водителя никуда не исчезают. Так же и с корпоративным ИИ: регулярность работы важна, а решает весь набор затрат и качество результата.
AI Office проектируется по принципу local-first с управляемым подключением облачных моделей. Массовую работу имеет смысл оставлять локально там, где это подтверждено качеством и нагрузочными проверками; внешние модели подключать там, где их результат оправдывает расходы и разрешена передача данных. Начать стоит с одного процесса и его измеримой стоимости — тогда выбор архитектуры будет опираться на экономику вашей компании.
