LLM — это языковая модель, которая работает с текстом: отвечает на вопросы, переписывает, сокращает документы, вытаскивает данные и помогает формулировать мысли. По сути, это «умный текстовый движок», который можно встроить в сайт, бота, CRM или внутренний сервис. Чтобы такой движок заработал в продукте, используют API: программу, которая отправляет текст модели и получает ответ.
Дальше всё упирается не в «магический ИИ», а в практику — какие LLM выбрать, сколько это реально стоит в России и где чаще всего всё ломается на старте.
Что такое LLM и где она реально используется
LLM (Large Language Model) — большая языковая модель. Простыми словами, это «умный текстовый движок». В реальной жизни LLM её используют:
- для поддержки клиентов, где нужно быстро и однотипно отвечать на вопросы;
- в качестве помощников на сайте, которые подсказывают, куда нажать и что сделать;
- для разбора документов, когда нужно быстро понять суть, а не читать всё целиком;
- для поиска по базе знаний или инструкциям;
- чтобы автоматически заполнить заявку или карточку из свободного текста.
В Битрикс24, например, внедрён LLM Copilot, который работает и в чатах, и в новостях, и в работе менеджера, и генерирует короткие ответы. По типу «Здравствуйте! Ваш заказ №111 передан курьеру, ожидайте завтра до 15:00».

Если сервис умеет адекватно отвечать по-русски и не «плывёт» на формулировках, почти всегда за этим стоит LLM. Но сама модель — только половина дела. Вторая половина — как именно её подключили и ограничили.
Какие российские LLM обычно выбирают
На рынке много сервисов «про ИИ», но если говорить о сценарии «подключить русскоязычную LLM по API и использовать в продукте», чаще всего встречаются три направления.
LLM «Яндекс» (YandexGPT, Yandex Cloud, Yandex AI Studio)
Обычно выбирают, когда хочется «коробочно и стабильно»: понятная облачная инфраструктура, документация, явные лимиты и прозрачная тарификация по токенам. Большой плюс для разработчиков — режим API «как у OpenAI»: можно переехать с привычного кода, поменяв адрес и ключ.

LLM «Сбер» (GigaChat, Sber Developers)
Часто берут ради качества русского языка и понятной рублёвой экономики: есть бесплатный слой для старта и пакеты токенов. Минус — подключение LLM чуть «более корпоративное»: OAuth-токен, который живёт ограниченное время, и несколько обязательных заголовков.
У Сбера есть даже бесплатный курс по работе с Гигачатом:

Корпоративные платформы-агрегаторы (например, MTS Cotype и похожие)
Идея простая: один API «в стиле OpenAI», а дальше — выбор LLM и вариантов поставки (облако/гибрид/он-прем). Это удобно бизнесу, но тут важно не путаться: платформа может быть российской, а LLM внутри — разные. Поэтому всегда смотрят, какая модель реально стоит за конкретным endpoint’ом и где именно выполняется обработка.
Что такое «токены» и почему все считают деньги LLM именно так
Почти во всех LLM платят за объём текста: сколько вы отправили модели и сколько получили. Считается это в токенах — условных кусках текста.
На практике это означает простую вещь: длина ответа — главный фактор стоимости LLM.

Короткий вопрос и текст на 3–5 предложений стоят копейки. А просьбы вроде «объясни подробно», «разверни с примерами» и «перескажи весь документ» раздувают счёт в разы. Например, чат-бот поддержки с ответами по 200–300 токенов при 1 000 обращений в месяц на лёгкой LLM обходится в десятки рублей. Тот же бот, но с описанием «на страницу текста», легко становится в 5–10 раз дороже — без какой-то реальной пользы для пользователя.
Поэтому в LLM почти всегда экономят не на модели, а на длине и формате ответов.
Как подключить API LLM: два рабочих примера
У всех сервисов логика одинаковая: зарегистрировались → получили ключ → отправили запрос → получили текст. Разница заключается в деталях авторизации и адресах запросов. Есть два варианта, которые реально запускают в проектах.
Вариант 1. YandexGPT: быстрый старт и проверка через «curl»
Если хочется проверить LLM без программирования, удобнее всего начать с запроса из терминала (в командной строке). Это честный «тест на вход»: если «curl» работает — значит, ключи и доступ настроены правильно, и дальше уже можно переносить в код.
Мини-пример запроса:
| curl -X POST «https://llm.api.cloud.yandex.net/foundationModels/v1/completion» -H «Authorization: Api-Key ВАШ_API_KEY» -H «x-folder-id: ВАШ_FOLDER_ID» -H «Content-Type: application/json» -d ‘{ «modelUri»: «gpt://ВAШ_FOLDER_ID/yandexgpt/latest», «completionOptions»: {«stream»: false, «temperature»: 0.6, «maxTokens»: «300»}, «messages»: [ {«role»: «user», «text»: «Объясни простыми словами, что такое API.»} ] }’ |
Что здесь важно заметить глазами:
- Authorization: Api-Key … — ключ доступа;
- x-folder-id — folder ID, который часто забывают или путают;
- modelUri — ссылка на LLM;
- maxTokens — ограничение длины ответа (если поставить слишком много, объяснения станут длиннее и дороже);
- messages — это ваш диалог: кто что сказал и что нужно LLM.
Если вы делаете чат, обычно дальше добавляют стриминг (stream: true), чтобы текст «приходил» по мере генерации, а не одним куском.
Если «тест на вход» не работает — почти всегда проблема в одном из трёх мест:
- неверный API-ключ;
- перепутанный folder ID;
- доступы сервисного аккаунта.
Лайфхак. Пока не заработал один простой curl-запрос, не стоит лезть в SDK и сложную логику. Это экономит часы отладки.
Вариант 2. GigaChat: нюанс с OAuth-токеном
У GigaChat ключа «навсегда» обычно недостаточно. Сначала вы получаете временный токен доступа, а потом уже делаете запросы к LLM.

Выглядит это так:
- получаете OAuth-токен (он живёт ограниченное время, типично около 30 минут);
- с ним отправляете запрос в /chat/completions;
- по истечении времени обновляете токен.
Чтобы не утонуть в нюансах на старте, многие начинают через готовую библиотеку на Python, а уже потом переносят логику в свой код. У GigaChat есть один бытовой нюанс, который всплывает почти у всех на старте: иногда запросы падают из-за SSL-проверок и сертификатов, особенно в тестовых окружениях.
В примерах для разработки можно встретить временное отключение проверки сертификатов — это помогает понять, «всё вообще работает или нет». Но в рабочем окружении так оставлять не стоит: лучше сразу привести сертификаты и окружение в порядок, иначе проблемы вылезут позже и неожиданно.
Стоимость
У двух крупных провайдеров логика разная, но смысл один: платите за объём текста.
YandexGPT (Yandex Cloud AI Studio)
У Яндекса цены на API считаются за 1000 токенов текста. Они учитывают как вход (input), так и ответ LLM (output). Цены в документации указаны в долларах без НДС, но в рублях примерно следующие уровни:
| Модель LLM | Цена за 1000 токенов (sync) | Цена за 1000 токенов (async) |
| YandexGPT Lite | $0.001667 (~0.15–0.18 ₽) | $0.000834 (~0.08–0.10 ₽) |
| YandexGPT Pro 5.1 | $0.003334 (~0.30–0.35 ₽) | $0.001667 (~0.15–0.18 ₽) |
| YandexGPT Pro 5 | $0.010002 (~0.90–1.1 ₽) | $0.005001 (~0.45–0.55 ₽) |
Цены взяты из прайс-таблицы Yandex AI Studio, они могут меняться.
Если вы отправляете короткий запрос и получаете короткий текст (в сумме, например, ~500 токенов), это может стоить от 0.08 ₽ до ~0.55 ₽ в зависимости от выбранной модели LLM и режима.
Также пишут, что для YandexGPT 5.1 Pro цены могут быть порядка ~0.40 ₽ за 1000 токенов именно в деловых сценариях, что делает её доступной для интеграций в бизнес-продукты.
GigaChat (Сбер)
У GigaChat оплата обычно идёт пакетами на год (12 мес). Это фиксированные объёмы, которые можно расходовать по API.
Для физических лиц:
| Пакет | Количество токенов | Стоимость (₽) |
| 5 000 000 Lite | 5 000 000 | 1 000 ₽ |
| 30 000 000 Lite | 30 000 000 | 5 820 ₽ |
| 1 000 000 Pro | 1 000 000 | 1 500 ₽ |
| 5 000 000 Pro | 5 000 000 | 7 275 ₽ |
| 1 000 000 Max | 1 000 000 | 1 950 ₽ |
| 4 000 000 Max | 4 000 000 | 7 566 ₽ |
Данные из официального прайс-листа GigaChat API для физических лиц: лучше мониторить его, чтобы знать актуальные цены.
В Lite: ~0.20 ₽ / 1000 токенов (если считать 1 000 000 единиц за 200 ₽ эквивалента), на больших пакетах чуть дешевле. В Pro/Max: от ~0.30 до ~1.5 ₽ на 1000 токенов в зависимости от LLM и пакета.
Для юридических лиц цифры другие:
| Пакет | Токенов | Стоимость (₽) |
| 25 000 000 Lite | 25 000 000 | 5 000 ₽ |
| 125 000 000 Lite | 125 000 000 | 25 000 ₽ |
| 7 000 000 Pro | 7 000 000 | 10 500 ₽ |
| 200 000 000 Pro | 200 000 000 | 285 000 ₽ |
| 8 000 000 Max | 8 000 000 | 15 600 ₽ |
| 100 000 000 Max | 100 000 000 | 189 150 ₽ |
Это означает, что чем больший объём токенов вы покупаете, тем ниже средняя цена за 1000 токенов.
Если перевести эти цифры в реальную жизнь, выходит, что:
- бот поддержки с короткими фразами стоит десятки рублей в месяц;
- сайт или сервис с активными пользователями — сотни рублей;
- внутренний корпоративный инструмент с длинными ответами и документами — тысячи рублей и выше.
Как пишут предприниматели-практики, минимальный бюджет для внедрения ИИ в свой малый или средний бизнес, составляет 15 000 рублей в месяц.
Лимиты и ограничения
Ограничения у LLM почти всегда технические и почти всегда всплывают внезапно: вчера всё работало, сегодня — нет.
«401/403 и ничего не работает»
Почти всегда это ключи, права или неверный folder/project ID. Лучшее решение — сначала добиться, чтобы работал один простой запрос, и только потом усложнять.
«Слишком дорого»
Обычно виноваты высокий maxTokens и большие куски текста, которые без фильтра отправляют LLM. Лечится жёсткими лимитами и предварительным сжатием входных данных.
Проблемы с окружением и сертификатами
Это не про «модель плохая», а про окружение. Для теста иногда обходят проверку, но в проде лучше закрыть вопрос корректно.
Как LLM могут помочь в работе и повседневных задачах
LLM чаще всего подключают, чтобы снять рутину: быстрее отвечать, разбирать тексты, вытаскивать данные. Вот, где они реально могут сэкономить вам время:
Помощь в поддержке и ответах клиентам. LLM получает вопрос пользователя и короткую справку из базы знаний и формулирует ответ. Если заранее задать тон и ограничить длину, бот закрывает до 60–70 % типовых вопросов без участия оператора. Например, на основе LLM работает приложение «СберЗдоровье». Нейросеть ставила диагнозы с точностью до 93%. Но пока это эксперименты.

Быстрые выжимки из документов. LLM помогает быстро понять, о чём длинный договор или письмо: сроки, риски, ключевые пункты. Это экономит время, когда нужно принять решение. Та же Alice AI работает на основе языковых моделях, и выполняет подобные функции.
Автоматическая обработка заявок и сообщений. Свободный текст превращается в структуру: имя, город, задача, приоритет. Такой результат удобно передавать в CRM или таблицу без ручного разбора.
Как выбрать модель
Если нужно быстро и предсказуемо подключить LLM по API, размышляйте так:
- хотите минимум возни с кодом и привычный формат запросов — смотрите YandexGPT;
- хотите рублёвые пакеты и сильный «русский голос» — смотрите GigaChat;
- нужен договор, SLA, контуры и варианты поставки — смотрите корпоративные платформы, но уточняйте, какие LLM реально используются.
И ещё один здравый критерий: не «какая модель самая умная», а «какая решает вашу задачу дешевле и стабильнее». Для поддержки и автозаполнения часто хватает более лёгких LLM. «Тяжёлые» берут там, где реально нужен сложный анализ, длинный контекст и аккуратный стиль.
Заключение
Российские LLM в 2025 — это обычный рабочий инструмент. Они подключаются по API и используются в реальных продуктах: от ботов поддержки до внутренних сервисов.
Если начать с простого запроса, ограничить длину ответов и считать финансы, запуск обычно проходит спокойно. А дальше всё решает то, насколько точно вы понимаете свою задачу и умеете держать модель в рамках. Vidu AI поможет вам в этом.
FAQ
Однозначного победителя нет. YandexGPT 5 Pro / 5.1 обычно выигрывает в скорости, анализе текстов, креативности и стабильности API. GigaChat 2 Max (особенно Max-версия) чаще берут за более «человеческий» русский стиль, точность в сложных профессиональных задачах и чуть лучшее поведение в длинных диалогах.
Очень сильно зависит от сценария. Простой бот поддержки (короткие ответы 150–300 токенов, 3–7 тыс. обращений в месяц) — 800–4 500 ₽. Средний трафик + более развёрнутые ответы — 8 000–25 000 ₽. Тяжёлый корпоративный сценарий с документами и длинным контекстом — от 40 000 ₽ и сильно выше. Самый популярный «стартовый» бюджет у малого бизнеса в 2025 — 12–18 тысяч рублей в месяц.
GigaChat использует OAuth2 с временным токеном (обычно 30–60 минут), что раздражает при быстрой разработке. YandexGPT работает по классической схеме OpenAI-стиля: постоянный Api-Key + folder-id. Поэтому 80–85 % разработчиков в 2025 году начинают именно с Яндекса — меньше головной боли на старте.
