Русскоязычные LLM-модели: что выбрать, сколько стоит и как подключить API

Русскоязычные LLM-модели: что выбрать, сколько стоит и как подключить API
Автор: valeria
0

LLM — это языковая модель, которая работает с текстом: отвечает на вопросы, переписывает, сокращает документы, вытаскивает данные и помогает формулировать мысли. По сути, это «умный текстовый движок», который можно встроить в сайт, бота, CRM или внутренний сервис. Чтобы такой движок заработал в продукте, используют API: программу, которая отправляет текст модели и получает ответ.

Дальше всё упирается не в «магический ИИ», а в практику — какие LLM выбрать, сколько это реально стоит в России и где чаще всего всё ломается на старте.

Что такое LLM и где она реально используется

LLM (Large Language Model) — большая языковая модель. Простыми словами, это «умный текстовый движок». В реальной жизни LLM её используют:

  • для поддержки клиентов, где нужно быстро и однотипно отвечать на вопросы;
  • в качестве помощников на сайте, которые подсказывают, куда нажать и что сделать;
  • для разбора документов, когда нужно быстро понять суть, а не читать всё целиком;
  • для поиска по базе знаний или инструкциям;
  • чтобы автоматически заполнить заявку или карточку из свободного текста. 

В Битрикс24, например, внедрён LLM Copilot, который работает и в чатах, и в новостях, и в работе менеджера, и генерирует короткие ответы. По типу «Здравствуйте! Ваш заказ №111 передан курьеру, ожидайте завтра до 15:00».

LLM в чате

Если сервис умеет адекватно отвечать по-русски и не «плывёт» на формулировках, почти всегда за этим стоит LLM. Но сама модель — только половина дела. Вторая половина — как именно её подключили и ограничили.

Какие российские LLM обычно выбирают

На рынке много сервисов «про ИИ», но если говорить о сценарии «подключить русскоязычную LLM по API и использовать в продукте», чаще всего встречаются три направления.

LLM «Яндекс» (YandexGPT, Yandex Cloud, Yandex AI Studio)

Обычно выбирают, когда хочется «коробочно и стабильно»: понятная облачная инфраструктура, документация, явные лимиты и прозрачная тарификация по токенам. Большой плюс для разработчиков — режим API «как у OpenAI»: можно переехать с привычного кода, поменяв адрес и ключ. 

модели в LLM Яндекса

LLM «Сбер» (GigaChat, Sber Developers)

Часто берут ради качества русского языка и понятной рублёвой экономики: есть бесплатный слой для старта и пакеты токенов. Минус — подключение LLM чуть «более корпоративное»: OAuth-токен, который живёт ограниченное время, и несколько обязательных заголовков.

У Сбера есть даже бесплатный курс по работе с Гигачатом:

курс по работе с LLM Гигачат

Корпоративные платформы-агрегаторы (например, MTS Cotype и похожие)

Идея простая: один API «в стиле OpenAI», а дальше — выбор LLM и вариантов поставки (облако/гибрид/он-прем). Это удобно бизнесу, но тут важно не путаться: платформа может быть российской, а LLM внутри — разные. Поэтому всегда смотрят, какая модель реально стоит за конкретным endpoint’ом и где именно выполняется обработка.

Что такое «токены» и почему все считают деньги LLM именно так

Почти во всех LLM платят за объём текста: сколько вы отправили модели и сколько получили. Считается это в токенах — условных кусках текста.

На практике это означает простую вещь: длина ответа — главный фактор стоимости LLM.

схема как работают токены

Короткий вопрос и текст на 3–5 предложений стоят копейки. А просьбы вроде «объясни подробно», «разверни с примерами» и «перескажи весь документ» раздувают счёт в разы. Например, чат-бот поддержки с ответами по 200–300 токенов при 1 000 обращений в месяц на лёгкой LLM обходится в десятки рублей. Тот же бот, но с описанием «на страницу текста», легко становится в 5–10 раз дороже — без какой-то реальной пользы для пользователя.

Поэтому в LLM почти всегда экономят не на модели, а на длине и формате ответов.

Как подключить API LLM: два рабочих примера

У всех сервисов логика одинаковая: зарегистрировались → получили ключ → отправили запрос → получили текст. Разница заключается в деталях авторизации и адресах запросов. Есть два варианта, которые реально запускают в проектах.

Вариант 1. YandexGPT: быстрый старт и проверка через «curl»

Если хочется проверить LLM без программирования, удобнее всего начать с запроса из терминала (в командной строке). Это честный «тест на вход»: если «curl» работает — значит, ключи и доступ настроены правильно, и дальше уже можно переносить в код. 

Мини-пример запроса:

curl -X POST «https://llm.api.cloud.yandex.net/foundationModels/v1/completion»   -H «Authorization: Api-Key ВАШ_API_KEY»   -H «x-folder-id: ВАШ_FOLDER_ID»   -H «Content-Type: application/json»   -d ‘{    «modelUri»: «gpt://ВAШ_FOLDER_ID/yandexgpt/latest»,    «completionOptions»: {«stream»: false, «temperature»: 0.6, «maxTokens»: «300»},    «messages»: [      {«role»: «user», «text»: «Объясни простыми словами, что такое API.»}    ]  }’

Что здесь важно заметить глазами:

  • Authorization: Api-Key … — ключ доступа;
  • x-folder-id — folder ID, который часто забывают или путают;
  • modelUri — ссылка на LLM;
  • maxTokens — ограничение длины ответа (если поставить слишком много, объяснения станут длиннее и дороже);
  • messages — это ваш диалог: кто что сказал и что нужно LLM.

Если вы делаете чат, обычно дальше добавляют стриминг (stream: true), чтобы текст «приходил» по мере генерации, а не одним куском.

Если «тест на вход» не работает — почти всегда проблема в одном из трёх мест:

  • неверный API-ключ;
  • перепутанный folder ID;
  • доступы сервисного аккаунта.

Лайфхак. Пока не заработал один простой curl-запрос, не стоит лезть в SDK и сложную логику. Это экономит часы отладки.

Вариант 2. GigaChat: нюанс с OAuth-токеном

У GigaChat ключа «навсегда» обычно недостаточно. Сначала вы получаете временный токен доступа, а потом уже делаете запросы к LLM. 

Русскоязычные LLM-модели: что выбрать, сколько стоит и как подключить API

Выглядит это так:

  • получаете OAuth-токен (он живёт ограниченное время, типично около 30 минут);
  • с ним отправляете запрос в /chat/completions;
  • по истечении времени обновляете токен.

Чтобы не утонуть в нюансах на старте, многие начинают через готовую библиотеку на Python, а уже потом переносят логику в свой код. У GigaChat есть один бытовой нюанс, который всплывает почти у всех на старте: иногда запросы падают из-за SSL-проверок и сертификатов, особенно в тестовых окружениях.

В примерах для разработки можно встретить временное отключение проверки сертификатов — это помогает понять, «всё вообще работает или нет». Но в рабочем окружении так оставлять не стоит: лучше сразу привести сертификаты и окружение в порядок, иначе проблемы вылезут позже и неожиданно.

Стоимость

У двух крупных провайдеров логика разная, но смысл один: платите за объём текста. 

YandexGPT (Yandex Cloud AI Studio)

У Яндекса цены на API считаются за 1000 токенов текста. Они учитывают как вход (input), так и ответ LLM (output). Цены в документации указаны в долларах без НДС, но в рублях примерно следующие уровни:

Модель LLMЦена за 1000 токенов (sync)Цена за 1000 токенов (async)
YandexGPT Lite$0.001667 (~0.15–0.18 ₽)$0.000834 (~0.08–0.10 ₽)
YandexGPT Pro 5.1$0.003334 (~0.30–0.35 ₽)$0.001667 (~0.15–0.18 ₽)
YandexGPT Pro 5$0.010002 (~0.90–1.1 ₽)$0.005001 (~0.45–0.55 ₽)

Цены взяты из прайс-таблицы Yandex AI Studio, они могут меняться.

Если вы отправляете короткий запрос и получаете короткий текст (в сумме, например, ~500 токенов), это может стоить от 0.08 ₽ до ~0.55 ₽ в зависимости от выбранной модели LLM и режима.

Также пишут, что для YandexGPT 5.1 Pro цены могут быть порядка ~0.40 ₽ за 1000 токенов именно в деловых сценариях, что делает её доступной для интеграций в бизнес-продукты.

GigaChat (Сбер)

У GigaChat оплата обычно идёт пакетами на год (12 мес). Это фиксированные объёмы, которые можно расходовать по API.

Для физических лиц:

ПакетКоличество токеновСтоимость (₽)
5 000 000 Lite5 000 0001 000 ₽
30 000 000 Lite30 000 0005 820 ₽
1 000 000 Pro1 000 0001 500 ₽
5 000 000 Pro5 000 0007 275 ₽
1 000 000 Max1 000 0001 950 ₽
4 000 000 Max4 000 0007 566 ₽

Данные из официального прайс-листа GigaChat API для физических лиц: лучше мониторить его, чтобы знать актуальные цены. 

В Lite: ~0.20 ₽ / 1000 токенов (если считать 1 000 000 единиц за 200 ₽ эквивалента), на больших пакетах чуть дешевле. В Pro/Max: от ~0.30 до ~1.5 ₽ на 1000 токенов в зависимости от LLM и пакета.

Для юридических лиц цифры другие:

ПакетТокеновСтоимость (₽)
25 000 000 Lite25 000 0005 000 ₽
125 000 000 Lite125 000 00025 000 ₽
7 000 000 Pro7 000 00010 500 ₽
200 000 000 Pro200 000 000285 000 ₽
8 000 000 Max8 000 00015 600 ₽
100 000 000 Max100 000 000189 150 ₽

Это означает, что чем больший объём токенов вы покупаете, тем ниже средняя цена за 1000 токенов. 

Если перевести эти цифры в реальную жизнь, выходит, что:

  • бот поддержки с короткими фразами стоит десятки рублей в месяц; 
  • сайт или сервис с активными пользователями — сотни рублей; 
  • внутренний корпоративный инструмент с длинными ответами и документами — тысячи рублей и выше.

Как пишут предприниматели-практики, минимальный бюджет для внедрения ИИ в свой малый или средний бизнес, составляет 15 000 рублей в месяц. 

Лимиты и ограничения

Ограничения у LLM почти всегда технические и почти всегда всплывают внезапно: вчера всё работало, сегодня — нет.

«401/403 и ничего не работает»

Почти всегда это ключи, права или неверный folder/project ID. Лучшее решение — сначала добиться, чтобы работал один простой запрос, и только потом усложнять.

«Слишком дорого»

Обычно виноваты высокий maxTokens и большие куски текста, которые без фильтра отправляют LLM. Лечится жёсткими лимитами и предварительным сжатием входных данных.

Проблемы с окружением и сертификатами

Это не про «модель плохая», а про окружение. Для теста иногда обходят проверку, но в проде лучше закрыть вопрос корректно.

Как LLM могут помочь в работе и повседневных задачах

LLM чаще всего подключают, чтобы снять рутину: быстрее отвечать, разбирать тексты, вытаскивать данные. Вот, где они реально могут сэкономить вам время:

Помощь в поддержке и ответах клиентам. LLM получает вопрос пользователя и короткую справку из базы знаний и формулирует ответ. Если заранее задать тон и ограничить длину, бот закрывает до 60–70 % типовых вопросов без участия оператора. Например, на основе LLM работает приложение «СберЗдоровье». Нейросеть ставила диагнозы с точностью до 93%. Но пока это эксперименты. 

ответ ИИ в отзывах
Генерация ответов на отзывы — ещё одна фича от нейронки

Быстрые выжимки из документов. LLM помогает быстро понять, о чём длинный договор или письмо: сроки, риски, ключевые пункты. Это экономит время, когда нужно принять решение. Та же Alice AI работает на основе языковых моделях, и выполняет подобные функции. 

Автоматическая обработка заявок и сообщений. Свободный текст превращается в структуру: имя, город, задача, приоритет. Такой результат удобно передавать в CRM или таблицу без ручного разбора.

Как выбрать модель

Если нужно быстро и предсказуемо подключить LLM по API, размышляйте так:

  • хотите минимум возни с кодом и привычный формат запросов — смотрите YandexGPT;
  • хотите рублёвые пакеты и сильный «русский голос» — смотрите GigaChat;
  • нужен договор, SLA, контуры и варианты поставки — смотрите корпоративные платформы, но уточняйте, какие LLM реально используются.

И ещё один здравый критерий: не «какая модель самая умная», а «какая решает вашу задачу дешевле и стабильнее». Для поддержки и автозаполнения часто хватает более лёгких LLM. «Тяжёлые» берут там, где реально нужен сложный анализ, длинный контекст и аккуратный стиль.

Заключение

Российские LLM в 2025 — это обычный рабочий инструмент. Они подключаются по API и используются в реальных продуктах: от ботов поддержки до внутренних сервисов. 

Если начать с простого запроса, ограничить длину ответов и считать финансы, запуск обычно проходит спокойно. А дальше всё решает то, насколько точно вы понимаете свою задачу и умеете держать модель в рамках. Vidu AI поможет вам в этом.

FAQ

Какая русская нейросеть лучше в 2025 году — YandexGPT или GigaChat?

Однозначного победителя нет. YandexGPT 5 Pro / 5.1 обычно выигрывает в скорости, анализе текстов, креативности и стабильности API. GigaChat 2 Max (особенно Max-версия) чаще берут за более «человеческий» русский стиль, точность в сложных профессиональных задачах и чуть лучшее поведение в длинных диалогах.

Сколько реально стоит чат-бот на YandexGPT или GigaChat в месяц в России?

Очень сильно зависит от сценария. Простой бот поддержки (короткие ответы 150–300 токенов, 3–7 тыс. обращений в месяц) — 800–4 500 ₽. Средний трафик + более развёрнутые ответы — 8 000–25 000 ₽. Тяжёлый корпоративный сценарий с документами и длинным контекстом — от 40 000 ₽ и сильно выше. Самый популярный «стартовый» бюджет у малого бизнеса в 2025 — 12–18 тысяч рублей в месяц.

Почему API GigaChat такой сложный по сравнению с YandexGPT?

GigaChat использует OAuth2 с временным токеном (обычно 30–60 минут), что раздражает при быстрой разработке. YandexGPT работает по классической схеме OpenAI-стиля: постоянный Api-Key + folder-id. Поэтому 80–85 % разработчиков в 2025 году начинают именно с Яндекса — меньше головной боли на старте.

Комментарии: 0
Как вам статья?
/ 5
valeria
Автор:
valeria
Комментарии (0)
Читатели еще не оставили комментарий, будьте первым!

— для отправки комментария вам необходимо
Забыли пароль?

Введите ваше имя пользователя или адрес email. Вы получите email сообщение с инструкциями по сбросу пароля.

Создание аккаунта

X