Перейти к содержанию

06. Инфраструктура и стоимость (РФ, июль 2026)

1. Стоимость аренды GPU (облако)

1.1. immers.cloud — почасовая опция GPU

Источник: immers.cloud/prices (проверено 07.2026). Скидки при предоплате: 10% (30 дней), 15% (60), 20% (180), 25% (360).

  • H200 141GB PCI-E — 390,00 ₽/ч
  • H100 NVL 94GB PCI-E — 340,00 ₽/ч
  • H100 80GB PCI-E — 320,00 ₽/ч
  • A100 80GB PCI-E — 190,00 ₽/ч
  • RTX 5090 32GB — 120,00 ₽/ч
  • RTX 4090 24GB — 75,00 ₽/ч
  • A10 24GB — 30,80 ₽/ч
  • Tesla T4 16GB — 16,00 ₽/ч

1.2. immers.cloud — готовые облачные конфигурации (помесячно)

1.3. immers.cloud — выделенные (dedicated) серверы

Источник: immers.cloud/dedicated (проверено 07.2026). - A100 80GB ×2 / Xeon 6336Y / 128 ГБ RAM / SSD 7680: 283 356 ₽/мес - A100 80GB ×4 / 2× Xeon 4410Y / 512 ГБ / NVMe 3840: 555 732 ₽/мес

1.4. Selectel — Cloud GPU

Источник: selectel.ru/services/cloud/servers (prices), калькулятор: selectel.ru/prices/calculator (проверено 07.2026, НДС 22%). - Линейка GPU (T4, A100, A30, L4, RTX 4090, H100, H200, RTX 6000 Pro и др.) — от 21 999 ₽/мес за базовую конфигурацию; итог считается в калькуляторе от vCPU/RAM/диска/GPU. - Почасовые ориентиры (по обзору tproger, 2026): A100 — 211,77 ₽/ч, H100 — 341,77 ₽/ч, H100 NVL — 367,41 ₽/ч, H200 — 423,04 ₽/ч.

Вывод по аренде: лучший «вход» для инференса 27-35B — 1× A100 80GB (~150 тыс. ₽/мес) или 1× H100 80GB (~246 тыс. ₽/мес). Для роутера/ярус-0 — дешёвые L4/A10/RTX 4090.

3. Не-GPU инфраструктура (managed-сервисы)

  • Managed PostgreSQL (per-tenant) — pay-as-you-go по vCPU/RAM/диску, расчёт в калькуляторе — selectel.ru/.../postgresql
  • Объектное хранилище S3 — стандартное хранение от 2,56 ₽/ГБ/мес + запросы к API + исходящий трафик; входящий и внутренний трафик бесплатны — docs.selectel.ru/s3/payment
  • CPU-инстансы / Kubernetes / балансировщики / вектор-БД (Qdrant на VM) — считаются в калькуляторе Selectel.
  • Ориентир CPU-обвязки (API Gateway, сервисы, Redis, Kafka, Qdrant, мониторинг): на пилоте ~20-60 тыс. ₽/мес, с ростом — линейно вверх и в HA (×2).

4. Развилка: managed LLM API vs self-hosted GPU

4.1. Цены managed LLM

Основной кандидат старта — Qwen API (Alibaba Cloud Model Studio, International/Singapore). Оплата по токенам, OpenAI-совместимый эндпоинт (.../compatible-mode/v1). Источники: Model Studio pricing, Qwen Cloud pricing, cloudprice.net/qwen3-max (проверено 07.2026):

Модель Роль Вход, $/1M Выход, $/1M Вход, ₽/1M (×90) Выход, ₽/1M
qwen3.7-max ярус-2 / сложное, фолбэк 2,50 (промо 1,25) 7,50 (промо 3,75) ~112 ~337
qwen3.7-plus ярус-1 «мозг» 0,40 1,60 ~36 ~144
qwen3.6-flash ярус-0 0,25 1,50 ~22 ~135
qwen3.5-flash ярус-0 (дёшево, длинный контекст) 0,10 0,40 ~9 ~36

Дополнительно: implicit cache снижает цену повторного входа (для max — $0,32 вместо $1,6/1M, ~5×) — важно, т.к. системный промпт + RAG повторяются; batch API — −50% (для офлайн-задач, не для realtime-диалога). Тиры по длине контекста: цены выше — для входа ≤256K; при 256K-1M растут.

Альтернативы (РФ, для переноса LLM-слоя): - GigaChat (юрлица, с 01.02.2026, вкл. НДС; async — вдвое дешевле; мин. 600 ₽/мес) — developers.sber.ru/.../legal-tariffs: - Lite — 0,065 ₽ / 1000 токенов (= 65 ₽/1M) - Pro — 0,5 ₽ / 1000 токенов (= 500 ₽/1M) - Max — 0,65 ₽ / 1000 токенов (= 650 ₽/1M) - YandexGPT (ориентир): lite — 0,2 ₽ вход / 0,4 ₽ выход за 1К; полная — 1 ₽ / 2 ₽ за 1К — unoapi.ru: сравнение.

Сопоставление за 1M токенов (вход/выход, ₽): Qwen plus 36/144 ≪ GigaChat Pro 500/500 ≈ YandexGPT полная ~90/180. То есть Qwen plus/flash в разы дешевле GigaChat Pro/YandexGPT full, а по качеству кодинга/рассуждений — сильнее. GigaChat/YandexGPT выигрывают в другом: данные в РФ (152-ФЗ), оплата в рублях, естественный русский «из коробки».

4.4. Критичные оговорки по облачному Qwen

  • 152-ФЗ / трансграничная передача ПДн. Эндпоинт International — Сингапур. Имя/телефон/адрес лида (персональные данные граждан РФ) уходят за границу. Для платформы, продающей compliance застройщикам, на проде это блокер без одного из: (а) обезличивания/маскирования ПДн перед отправкой в облако (телефоны/имена → плейсхолдеры, восстановление на своей стороне; план и производительность — 05, §8.2); (б) юридического согласия на трансграничную передачу (ст. 12 152-ФЗ) + уведомление РКН; (в) перехода на self-host в РФ для чувствительных тенантов. Рекомендация: на пилоте — маскирование ПДн + обезличенные диалоги; на проде — self-host для тенантов с жёсткими требованиями.
  • Оплата из РФ. Alibaba Cloud International требует зарубежную карту/юрлицо. Заложить платёжный контур (нерезидентное юрлицо/партнёр-реселлер) либо использовать российские API (GigaChat/YandexGPT) как основной биллинг-путь.
  • Латентность. Сингапур ≈ 150-250 мс RTT из РФ + время генерации. Для текстового чата приемлемо; для голоса (real-time STT+TTS) — заметно, тут предпочтительнее РФ-хостинг/self-host.
  • Санкционные/доступностные риски. Внешний вендор может ограничить доступ. Именно поэтому LLM-слой делаем провайдер-агностичным (см. 05, §8) с горячим фолбэком на GigaChat/YandexGPT/self-host.

4.2. Двухъярусная модель LLM и стоимость обращения

По решению проекта используем две модели Qwen API: - qwen3.6-flash — «маленький» дешёвый ярус для простых операционных задач (роутинг, классификация, сбор данных, типовые FAQ); - qwen3.7-max — «самый умный» ярус для тяжёлых задач, где нужны рассуждение и размышление (сложная квалификация, работа с возражениями, нетривиальные решения).

Базовый сплит: 80% flash / 20% max (настраивается; см. чувствительность ниже).

Стоимость 1 обращения (2 500 вход + 250 выход токенов, ×90 ₽/$):

Ярус ₽ / обращение
qwen3.6-flash 0,090 ₽
qwen3.7-max (промо) 0,366 ₽
Микс 80/20 (базовый) ≈ 0,145 ₽

Отсюда LLM ≈ 1 959 ₽ на тенанта в месяц (при 30 лидов/день × 15 обращений × 30 дней = 13 500 обращений/тенант/мес).

Чувствительность (рычаги стоимости): - всё на flash (90/10): ~0,10-0,12 ₽/обр → дешевле базы на ~20-38%; - больше рассуждений (70/30): ~0,17 ₽/обр → дороже базы на ~19%; - ввести средний ярус qwen3.7-plus (0,126 ₽/обр) вместо части max → микс 70/25/5 ≈ 0,113 ₽/обр (−22% к базе). Рекомендуемая оптимизация, когда качество plus достаточно.

4.3. Точка окупаемости self-host (справочно)

Аренда GPU становится дешевле Qwen API (микс 80/20, 0,145 ₽/обр) начиная с:

Порог сравнения ≈ лидов/день ≈ тенантов (30 лидов/тенанта)
1× A100 80GB = 152 474 ₽/мес ~2 335 ~78
1× H100 80GB = 246 074 ₽/мес ~3 768 ~126

Вывод: при дорогом ярусе max точка окупаемости смещается в район ~100 тенантов — что совпадает с началом этапа 3. Поэтому переход на аренду GPU на этапе 3 обоснован и по цене, и по 152-ФЗ / контролю / латентности (см. 4.4).

5. Оценка стоимости по этапам (по числу тенантов, с длительностью)

5.0. Допущения расчёта

Параметр Значение
«Пользователь» = тенант (компания-клиент платформы)
Лидов/день на 1 тенанта 30 (мин) … 1000 (макс)
Обращений к LLM на 1 лид 15
Токенов на обращение 2 500 вход + 250 выход
Курс 90 ₽/$
Ярусы LLM (этапы 1-2) qwen3.6-flash 80% + qwen3.7-max 20%
₽/обращение (микс 80/20) ≈ 0,145 ₽
LLM на 1 тенанта/мес ≈ 1 959 ₽ (30 лидов) … ≈ 65 306 ₽ (1000 лидов)
Инфра (CPU/БД/S3/K8s) аренда с 1-го дня (Selectel/immers), РФ
GPU только этап 3 (аренда, динамический сайзинг по нагрузке)

min этапа = нижняя граница тенантов × 30 лидов/день + нижняя оценка инфры (консервативный сценарий). max = верхняя граница тенантов × 1000 лидов/день + верхняя оценка инфры и HA (агрессивный потолок). Разброс широкий сознательно — он показывает «сколько минимум» и «сколько максимум» может понадобиться. Реальные значения обычно ближе к нижней/средней части диапазона. Суммы — порядок величины; финализируются в калькуляторах Selectel и immers.cloud. Не включены: команда/ФОТ, платные каналы (WhatsApp Business API, телефония, SMS) — см. §6.

5.1. Этап 1 — Пилот · 1-20 тенантов · Qwen API + маскирование ПДн · 3 месяца

Компонент мин (1 тенант × 30 лидов) макс (20 тенантов × 1000 лидов) Источник
LLM — Qwen API (flash+max) ~1 959 ₽ ~1 306 125 ₽ Model Studio pricing
Инфра: CPU-сервисы + Managed PostgreSQL + S3 + Qdrant (аренда) ~25 000 ₽ ~90 000 ₽ Selectel калькулятор, S3
Итого, ₽/мес ~27 тыс. ~1,40 млн
За 3 месяца ~81 тыс. ~4,19 млн

5.2. Этап 2 — Рост · 20-100 тенантов · Qwen API · 3 месяца

Компонент мин (20 тенантов × 30 лидов) макс (100 тенантов × 1000 лидов) Источник
LLM — Qwen API (flash+max) ~39 184 ₽ ~6 530 625 ₽ Model Studio pricing
Инфра: БД (HA, per-tenant) + S3 + Qdrant + CPU-сервисы в HA + K8s + мониторинг ~120 000 ₽ ~400 000 ₽ Selectel калькулятор, Managed PostgreSQL
Итого, ₽/мес ~159 тыс. ~6,93 млн
За 3 месяца ~478 тыс. ~20,79 млн

При высокой нагрузке (близко к 1000 лидов/тенанта) стоимость Qwen API резко растёт — в этой зоне экономически выгоднее раньше перейти на аренду GPU (см. §4.3). Верхняя граница здесь — теоретический потолок «полный этап × максимальная нагрузка».

5.3. Этап 3 — Масштаб · 100-1000 тенантов · аренда GPU · бессрочно (прогноз ₽/мес)

На этом этапе LLM переезжает на self-hosted Qwen в РФ (аренда GPU). «Мозг» — открытые веса Qwen 27-35B (проприетарный max доступен только в облаке; самые тяжёлые случаи можно роутить в облачный qwen3.7-max как burst обезличенно). Ярус-0 (flash-задачи) — малый Qwen 4-8B на дешёвых GPU. Число GPU считается динамически по пиковой нагрузке (20% дневного объёма в час; H100 ≈ 6 обр/сек «мозг», A10/L4 ≈ 20 обр/сек ярус-0).

Компонент мин (100 тенантов × 30 лидов) макс (1000 тенантов × 1000 лидов) Источник
Нагрузка 3 тыс. лидов/день (~2,5 обр/сек пик) 1 млн лидов/день (~833 обр/сек пик) расчёт
GPU «мозг» (H100) 2× H100 ≈ 492 148 ₽ 28× H100 ≈ 6 890 072 ₽ immers.cloud/gpu/h100
GPU ярус-0 (A10/L4) 2× A10 ≈ 44 968 ₽ 34× A10 ≈ 764 456 ₽ immers.cloud/prices
Инфра: БД/вектор/хранилище в HA + CPU + сеть + observability + резерв ~450 000 ₽ ~1 400 000 ₽ Selectel калькулятор
Итого, ₽/мес ~0,99 млн ~9,05 млн

Верхняя граница (1000 тенантов × 1000 лидов = 1 млн лидов/день) — гиперскейл; при таких объёмах разумны покупка/лизинг железа и мультирегион. Аренда vs покупка: сервер 8× H100 ≈ 22-35 млн ₽ единоразово (см. §2); окупаемость ~12-24 мес при высокой утилизации.

5.4. Сводка: сколько денег нужно по этапам

Этап Длительность ₽/мес мин ₽/мес макс За период мин За период макс
1 — Пилот (1-20 тенантов) 3 мес ~27 тыс. ~1,40 млн ~81 тыс. ~4,19 млн
2 — Рост (20-100 тенантов) 3 мес ~159 тыс. ~6,93 млн ~478 тыс. ~20,79 млн
Старт (этапы 1+2) 6 мес ~558 тыс. ~24,98 млн
3 — Масштаб (100-1000 тенантов) бессрочно ~0,99 млн ~9,05 млн — (в месяц) — (в месяц)

Итого на запуск (первые 6 месяцев): от ~558 тыс. ₽ (консервативно: мало тенантов, 30 лидов/день) до ~24,98 млн ₽ (агрессивный потолок: полные этапы, 1000 лидов/день на тенанта). Реалистичный бюджет обычно в нижней-средней части диапазона; уточняется по фактическому числу тенантов и их нагрузке (лист «Этапы» и «Графики» в Excel-модели).

6. Удельная экономика (₽/лид) и что не входит

Стоимость на лид (только инфраструктура, база 80/20): - LLM на лид почти не зависит от масштаба: 15 обращений × 0,145 ₽ ≈ 2,2 ₽/лид (всё на flash ≈ 1,4 ₽; всё на max ≈ 5,5 ₽). Это «переменная» часть — растёт линейно с числом лидов. - Инфра/GPU на лид падает с ростом нагрузки (амортизируется по объёму): этап 1 при 1 тенанте × 30 лидов ≈ 30 ₽/лид; этап 3 при 1000 тенантов × 1000 лидов ≈ 0,3 ₽/лид. - Диапазон полной удельной стоимости по этапам: ~0,3 … ~30 ₽/лид (низ — гиперскейл, верх — стартовый пилот с минимальной загрузкой).

Не включено в расчёт (фиксируется отдельно с моделью монетизации, см. 00-overview.md): команда и MLOps/SRE (обычно крупнейшая статья), платные каналы (WhatsApp Business API за диалоги, телефония поминутно, SMS), лицензии/мониторинг, платёжный контур для оплаты Alibaba из РФ.

7. Итоговые рекомендации по инфраструктуре

  • LLM-слой — провайдер-агностичный с первого дня (OpenAI-совместимый интерфейс + адаптеры), чтобы переключать Qwen ↔ GigaChat ↔ YandexGPT ↔ self-host конфигом за ~час (см. 05, §8).
  • Этап 1 (Пилот, 1-20 тенантов, 3 мес): Qwen APIqwen3.6-flash для операционки + qwen3.7-max для рассуждений, с маскированием ПДн (см. 05, §8.2). Без capex. Резерв — GigaChat/YandexGPT.
  • Этап 2 (Рост, 20-100 тенантов, 3 мес): тот же Qwen API; наращиваем HA для данных, K8s-автоскейл, observability. GPU пока не поднимаем.
  • Этап 3 (Масштаб, 100-1000 тенантов, бессрочно): LLM на self-hosted Qwen в РФ (аренда GPU): «мозг» на открытых весах 27-35B + малый Qwen для ярус-0; облачный qwen3.7-max — burst для самых тяжёлых случаев (обезличенно). Обосновано и по цене (точка окупаемости ~100 тенантов), и по 152-ФЗ / контролю.
  • Инфра-обвязка (CPU, БД, S3, вектор, K8s) — аренда/облако в РФ (Selectel/immers) с 1-го дня на всех этапах: дёшево и 152-ФЗ соблюдён для данных, которые не уходят в LLM.
  • Все расчёты финализировать в калькуляторах: Selectel, immers.cloud; токены Qwen — в Model Studio pricing.