LLM API в России

LLM API в GEN202 — это языковые модели GPT, Gemini, Grok, Claude: они отвечают на вопросы, пишут и правят текст, разбирают документы и картинки, а вызываются в формате OpenAI Chat Completions. Самая низкая ставка входа — 46 ₽ за миллион токенов — до 10% ниже официальной цены. Купить API ключ к нейросети здесь — значит получить один ключ на весь каталог: оплата рублями с российской карты, VPN не нужен. Первый вызов — один запрос с примерами на curl и Python.

Цены на LLM API

Цена за миллион токенов, отдельно за вход и за выход. Списывается фактический расход из поля usage ответа.

Модель Поставщик Скидка от официальной цены Цена от, за миллион токенов
GPT 5.6 OpenAI до −10% $0.4646 ₽
GPT 6 Astra OpenAI $23.082308 ₽
Gemini 3.6 Flash Google $1.73173 ₽
Gemini 3.7 Flash Google $1.73173 ₽
Grok 4.5 xAI $4.615461,5 ₽
Grok 4.6 xAI $4.615461,5 ₽
Claude Opus 5 Anthropic $11.541154 ₽
Claude Sonnet 5 Anthropic $4.615461,5 ₽
Claude Fable 5 Anthropic $23.082308 ₽

Бренды языковых моделей

Языковые модели каталога сделаны компаниями: OpenAI, Google, xAI, Anthropic.

Какие языковые модели доступны по API

Языковых моделей в каталоге 11 — GPT 5.6 Luna, GPT 5.6 Terra, GPT 5.6 Sol, GPT 6 Astra, Gemini 3.6 Flash, Gemini 3.7 Flash, Grok 4.5, Grok 4.6, Claude Opus 5, Claude Sonnet 5 и Claude Fable 5. Стоят за ними 4 компании: OpenAI, Google, xAI и Anthropic. Счёт у всех идёт за миллион токенов, и самый дешёвый вход в каталоге стоит 46 ₽. Вызываются модели одинаково: имя нужной ставится в поле model, и остальное тело запроса от выбора не зависит.

Различаются модели ценой, размером окна контекста и тем, кто их сделал, — остальное у них общее. Поля запроса, форма ответа и перечень отказов заданы одним адресом на весь текстовый каталог, поэтому переход с одной модели на другую стоит одной строки: имя вида gpt/5-6-luna меняется на соседнее. Во сколько обходится миллион токенов у каждой, показывает таблица цен на её странице.

Часть имён — уровни одного семейства: у GPT 5.6 их 3 — Luna, Terra и Sol. Уровни живут на общей странице, потому что различает их только имя в поле model и ставка, а поля и ответ у них одни и те же; переключаются они там кнопками. Отсюда и счёт страниц: моделей 11, а страниц под ними 9.

МодельИмя в поле modelОкно контекстаВход за миллионВыход за миллион
GPT 5.6 Lunagpt/5-6-luna1 050 000 токенов46 ₽277 ₽
GPT 5.6 Terragpt/5-6-terra1 050 000 токенов461,5 ₽2769,5 ₽
GPT 5.6 Solgpt/5-6-sol1 050 000 токенов461,5 ₽2700 ₽
GPT 6 Astragpt/6-astra1 050 000 токенов2308 ₽11540 ₽
Gemini 3.6 Flashgemini/3-6-flash1 000 000 токенов173 ₽865,5 ₽
Gemini 3.7 Flashgemini/3-7-flash1 048 576 токенов173 ₽865,5 ₽
Grok 4.5grok/4-5500 000 токенов461,5 ₽1385 ₽
Grok 4.6grok/4-6500 000 токенов461,5 ₽1385 ₽
Claude Opus 5claude/opus-51 000 000 токенов1154 ₽5770 ₽
Claude Sonnet 5claude/sonnet-51 000 000 токенов461,5 ₽2308 ₽
Claude Fable 5claude/fable-51 000 000 токенов2308 ₽11540 ₽

Три числа в таблице — это всё, чем строки расходятся между собой. Окно контекста — предел на то, что уходит в один запрос: и само задание, и приложенные материалы, и вся прошлая переписка. Ставки берутся раздельно, поэтому длинное задание с коротким ответом и короткое задание с длинным ответом обходятся по-разному.

Русский текст дробится на большее число токенов, чем тот же смысл по-английски. Значит, в окно одного размера русского материала помещается меньше, а миллион токенов кончается раньше. Точное число возвращает поле usage в ответе, и мерить длину надёжнее на своих текстах.

Что разработчики пишут о доступе по странам

Россия не названа ни на одной странице разработчиков, которые здесь проверялись. Что у них опубликовано на самом деле — перечень поддерживаемых стран, дата на странице и вводная фраза к перечню — собрано ниже со ссылками.

У OpenAI это документ «Supported countries and territories»: перечень из 208 строк, и строки «Russia» в нём нет. Перед перечнем стоит предупреждение: «Accessing or offering access to our services outside of the countries and territories listed below may result in your account being blocked or suspended». Перевод наш: «Доступ к нашим услугам или предоставление доступа к ним за пределами перечисленных ниже стран и территорий может привести к блокировке или приостановке вашей учётной записи». Страница — перечень стран и территорий OpenAI.

У Google страница названа «Available regions for Google AI Studio and Gemini API», и внизу неё стоит дата «Last updated 2026-04-28 UTC». Сообщение, с которым сюда и приходят, разработчик приводит там же: «Regional restrictions: Google AI Studio is not available in your region». Перевод наш: «Региональные ограничения: Google AI Studio недоступна в вашем регионе». В перечне 230 строк, и «Russia» среди них тоже не стоит. Страница — регионы Gemini API и Google AI Studio.

У xAI про регионы сказано на странице о месте обработки запроса. Написано в ней так: «SpaceXAI may route requests between regions for capacity or reliability, so the processing location is not guaranteed». Перевод наш: «SpaceXAI может перекладывать запросы между регионами ради мощности или надёжности, поэтому место обработки не гарантировано». Страница — региональные точки входа xAI.

Страницы Anthropic о странах 16 сентября 2026 года не проверяли, поэтому её слов здесь нет. Пропуск строки в чужом перечне сам по себе ничего не доказывает: в том же документе OpenAI нет ни Китая, ни Белоруссии, а строка про Украину несёт оговорку прямо в себе — «Ukraine (with certain exceptions)».

Условия трёх разработчиков приведены по их страницам на 16 сентября 2026 года.

Как считают токены у разработчиков и как здесь

Единица счёта у языковых моделей называется одинаково везде, где прайс открывается: миллион токенов, отдельно на вход и отдельно на выход. Отличаются разработчики не единицей, а тем, сколько ставок они разводят внутри неё.

Над таблицей текстовых моделей у OpenAI стоит подпись «Prices per 1M tokens» — перевод наш: «Цены за 1 миллион токенов». Столбцы под ней разведены дальше: «Short context input», «Short context cached input», «Short context cache writes», «Short context output» — то есть у входа, у чтения из кэша, у записи в кэш и у выхода ставки свои, и у каждой из них своя пара значений по длине запроса. Страница — цены OpenAI.

У Google столбец подписан «Paid Tier, per 1M tokens in USD», а строки внутри него названы «Input price», «Output price (including thinking tokens)» и «Context caching price». Перевод наш: «Платный уровень, за 1 миллион токенов в долларах»; «цена входа»; «цена выхода, включая токены размышления»; «цена кэширования контекста». Дата на странице — «Last updated 2026-09-15 UTC». Страница — цены Gemini API.

У xAI столбцы таблицы подписаны «Model | Context | Input / 1M tokens | Cached input / 1M tokens | Output / 1M tokens», а первой строкой над ними стоит оговорка «All prices are in USD» — перевод наш: «все цены в долларах». Единица та же, что у соседей по каталогу, а чтение из кэша вынесено своим столбцом. Страница — цены xAI.

В кредитах GEN202 единица та же: цена назначена за миллион токенов, а ставка входа со ставкой выхода стоят в каталоге разными строками. Сколько токенов списать, решает не наш подсчёт, а фактический расход: он берётся из поля usage ответа модели. Обе ставки по каждой модели собраны таблицей в начале страницы.

Чем вызов LLM отличается от картинок и видео

Ответ приходит на тот же запрос, которым его попросили. У изображения и ролика так не выходит: там сначала ставится задача, а потом её состояние опрашивают до готовности — этот порядок разобран в разделе «Как устроена задача». Языковой модели ждать нечего: готовый текст лежит в теле ответа, и второго обращения не нужно.

Форма запроса и ответа — OpenAI Chat Completions. Адрес один на все текстовые модели: POST https://api.gen202.com/v1/chat/completions, ключ уходит заголовком, на один ключ проходит 60 запросов в минуту. Поля и разбор ответа перечислены в разделе «Текстовые модели».

Написанный клиент переезжает сменой базового адреса, потому что у нас OpenAI совместимый API. Библиотеке OpenAI в настройках задаётся https://api.gen202.com/v1 и наш ключ, после чего прежний вызов чата работает как работал: ни имена полей, ни разбор ответа править не приходится. Так и выходит OpenAI совместимый LLM API в России: код остаётся прежним, меняются в нём базовый адрес и ключ, а расчёты с разработчиком ведёт GEN202.

Как получить API key для LLM и подставить его в код

API key для LLM выпускается в кабинете сразу после входа, и ждать одобрения заявки не приходится. Ключ один на весь каталог: им вызываются и языковые модели, и картиночные, и видеомодели. Имя ключу вы задаёте сами, длиной до 60 знаков, — по нему потом видно, какая программа им пользуется.

Порядок от пустого браузера до первого ответа модели укладывается в шесть шагов.

  1. Вход. Вход в кабинет идёт через Яндекс либо по разовой ссылке из письма, и своего пароля здесь заводить не надо.
  2. Кредиты. Новому счёту при первом входе начисляются приветственные кредиты, и первые вызовы оплачиваются ими.
  3. Выпуск ключа. В кабинете нажимают выпуск ключа и получают строку, которую подставляют в свою программу.
  4. Базовый адрес. Библиотеке OpenAI базовым адресом задают https://api.gen202.com/v1, а остаток пути до метода она дописывает сама.
  5. Заголовок доступа. Запрос, собранный руками, несёт ключ в заголовке Authorization по схеме Bearer, а тело помечает типом application/json.
  6. Первый вызов. В поле model ставят имя нужной строки каталога, в messages кладут сообщение, и текст возвращается тем же запросом.

Первый отказ чаще приходит из-за адреса или строки ключа, а не из-за выбранной модели. Адрес метода отвечает на запрос с телом, и открывать его ссылкой в браузере бесполезно. Лишний пробел по краям скопированного ключа читается как неверный ключ, поэтому строку сверяют целиком.

Базовый адрес пишут целиком и без косой черты на конце: лишняя черта складывается с началом пути и даёт адрес, которого у GEN202 нет. Отказ по доступу тоже не всегда про сам ключ — бывает, что программа не положила его в заголовок. Оба случая разбираются одним приёмом: тот же адрес и тот же ключ отправляют простым запросом из командной строки.

Готовый код обычно несёт поля настройки, которые вписала за вас библиотека. Такие поля принимаются без отказа: до модели доходят имя модели, список сообщений и потолок ответа. Сам потолок принимается под двумя именами, max_tokens и max_completion_tokens, поэтому и его в коде править не надо. Про заголовки запроса подробнее сказано в разделе «Ключ и заголовки».

API для чат-бота: что нужно, чтобы подключить

Боту нужно ровно то же, что разовому вызову: тот же ключ и тот же базовый адрес. Отдельного согласования под бота не предусмотрено, и той же строкой ключа вызывается любая модель каталога.

Сама переписка лежит в поле messages — списком сообщений, у каждого своя роль. В system пишут указание боту, в user — реплику собеседника, в assistant — прошлые ответы модели. Между запросами GEN202 ничего не помнит: модель видит ровно то, что вы положили в messages, поэтому историю разговора собирает сам бот, и с каждым запросом она отправляется заново.

Длину ответа просят полем max_tokens: целое от 1 до 128 000, а запрос без него считается просьбой на 1 024. Убедиться, что ключ и адрес работают, можно до первой строки кода — в песочнице на странице модели: она отправляет тот самый запрос, который будет слать ваш бот, и показывает, во что он обошёлся.

  • Расход у бота растёт по ходу беседы сам: каждая новая реплика уносит с собой все предыдущие.
  • Указание в роли system отправляется в каждом запросе, поэтому короткое указание обходится дешевле длинного.
  • Под новую тему выгоднее начать разговор заново: подрезанная история оборачивается переспрашиванием, и одна работа оплачивается дважды.

Сколько сообщений держать в переписке, решает сам бот, а предел ему ставит окно контекста выбранной модели. Когда история перестаёт помещаться, старые реплики либо убирают из списка, либо заменяют одним пересказом.

Сколько стоит миллион токенов и как считается расход

Платят за токены, а не за запросы, и ставок у модели две — на вход и на выход. Дешевле всего вход у GPT 5.6 Luna: 92 кредита за миллион токенов, это 46 ₽. Дороже всего выход у GPT 6 Astra — 23080 кредитов, или 11540 ₽. Выход стоит дороже входа у каждой модели каталога, а обе ставки сразу стоят таблицей выше.

Счёт выставляется по факту. Вместе с ответом приходит поле usage, в нём стоит число прочитанных и написанных токенов, и списывается ровно то, что там названо. Запрошенный потолок ответа на сумму не влияет: платят за токены, которые модель действительно прочитала и написала.

До ответа часть кредитов резервируется на балансе. Под вход удержание считается по длине отправленных сообщений, а под выход откладывается не меньше чем 4 000 токенов — больше, чем подставляется в max_tokens без вашей просьбы, потому что модели этот потолок соблюдают не всегда. Когда ответ разобран, лишнее удержание тем же запросом возвращается на баланс, а обращение, оборвавшееся на стороне модели, денег не стоит. Сколько ушло на каждый вызов, видно в кабинете, а из своей программы тот же расход спрашивается способом из раздела «Баланс и расход».

  1. Удержание. Перед обращением к модели часть кредитов замирает на счёте: свободный остаток уменьшается, а сам баланс стоит на месте.
  2. Оценка. Под вход откладывают по длине отправленных сообщений, а под ответ — по нижней границе GEN202.
  3. Вызов. Запрос уходит модели, и до её ответа отложенная сумма остаётся отложенной.
  4. Счёт. Из ответа берут поле usage и списывают ровно те токены, которые модель прочитала и написала.
  5. Возврат. Разницу между отложенным и потраченным возвращают на счёт тем же запросом.

Тесно поставленный потолок ответа не делает вызов дешевле. Часть работы модель пишет для себя, и эти токены считаются написанными наравне с видимым текстом. При слишком низком потолке видимого текста может не остаться вовсе, хотя токены уже потрачены.

Что именно считается токенами, разработчик перечисляет прямо: «Input tokens: Your query and conversation history. Reasoning tokens: Agent's internal thinking and planning. Completion tokens: The final response». Перевод наш: «Входные токены: ваш запрос и история переписки. Токены рассуждения: внутреннее обдумывание и планирование агента. Токены ответа: итоговый ответ». Перечень стоит на странице цен xAI, снятой 16 сентября 2026 года.

Разрыв между двумя ставками объясняется устройством работы, а не наценкой продавца. Отправленное модель прочитывает разом, а ответ выдаёт по одному куску, и каждый следующий кусок обходится ей дороже.

Что приходит в ответе на вызов текстовой модели

Ответ приходит одним объектом. Текст модели лежит в списке choices — в поле message.content его первого элемента. Рядом стоит finish_reason, и по нему видно, ответ закончился сам или упёрся в запрошенный потолок.

Второе поле, ради которого ответ разбирают, — usage. В нём три числа: prompt_tokens за прочитанное моделью, completion_tokens за написанное ею и total_tokens за оба вместе. Счёт выставляется по ним, поэтому цена вызова известна из того же ответа, что и текст.

Из программы это выглядит не так, как в чате браузера. В чате ответ печатается на экран, а здесь его разбирает ваш код: ни кнопок, ни настроек у вызова нет. Всё, чем в чате управляют мышью, здесь стоит полями тела запроса.

Поле ответаЧто в нём лежит
choices[0].message.contentТекст, который написала модель.
choices[0].finish_reasonПричина остановки: stop — закончила сама, length — упёрлась в потолок.
usage.prompt_tokensСколько токенов модель прочитала.
usage.completion_tokensСколько токенов модель написала.
usage.total_tokensОба числа вместе.

На вид оборванный ответ не отличается от законченного, поэтому поле причины смотрят и тогда, когда текст кажется целым. Дописывают такой ответ вторым вызовом, отправив в него уже полученную часть.

Есть ли бесплатные API нейросетей

Бесплатные API нейросетей у нас устроены так: ключ и доступ к каталогу ничего не стоят, а плата берётся за прошедшие через модель токены. Попробовать текстовую модель можно ещё до входа: бесплатный запрос даётся 1 раз в сутки. Отвечает на него gpt/5-6-luna, ответ доходит до 512 токенов, а сообщение принимается длиной до 500 символов.

Дальше идут приветственные кредиты: при первом входе на счёт кладётся 50 кредитов. Ими оплачиваются вызовы по обычной цене каталога, и ни выбор модели, ни длина ответа уже не ограничены. Списываются они так же, как купленные, — по числам из поля usage.

Когда приветственные кредиты кончились, работа идёт с баланса: каждый вызов мы оплачиваем разработчику модели, и счёт считается по фактическому расходу. Пополняется баланс рублями, готовыми пакетами на странице цен.

Что приходит при отказе

При отказе вместо текста приходит объект error, и внутри него лежат сообщение, тип и код. Форма та же, что у OpenAI, поэтому готовый клиент разбирает такой ответ сам. Таблица кодов с пояснением к каждому собрана в разделе «Отказы».

Часть отказов GEN202 даёт до обращения к разработчику: неверный ключ, нехватка свободных кредитов, поле запроса вне допустимых границ. Такой ответ не стоит ничего — кредиты за него не списываются. Сюда же относится превышение частоты: сверх названного выше потолка запросы не проходят.

Вторая половина отказов приходит со стороны модели: модель не ответила или запрос отклонён по её загрузке. Тогда удержание снимается целиком и вызов не тарифицируется, а повторить его можно через несколько секунд.

ОтветЧто произошлоКогда повторять
400Тело не прочиталось, имя модели незнакомо либо поле вышло за границы.После правки запроса
401Ключ не назван в заголовке, неверен или отключён.После проверки ключа
402Свободных кредитов меньше, чем удерживается под этот вызов.После пополнения
413Тело запроса переросло предел в 512 КиБ.После правки запроса
415В заголовке типа содержимого не назван application/json.После правки заголовка
429С одного ключа за минуту ушло больше 60 вызовов.Через минуту
502Ответ модели не разобрался или запрос до неё не дошёл.Сразу
503Модель перегружена или сработал её лимит.По сроку из Retry-After

Повторять имеет смысл не всякий отказ, и число ответа говорит, какой это случай. Деньги, разбор запроса и загрузка модели разведены по разным числам, поэтому причину не приходится искать перебором. На перегрузке срок повтора назван заголовком Retry-After, и клиентские библиотеки выдерживают эту паузу сами.

Потолок частоты у нас считается вызовами с одного ключа за минуту, а не объёмом отправленного текста. Поэтому один длинный запрос его в одиночку не выбирает.

Что показали независимые разборы доступа

Прямая формулировка про доступ из России нашлась не у разработчика, а в заметке издания The Register от 25 августа 2026 года, автор Brandon Vigliarolo. Издание пересказывает отчёт OpenAI и пишет: «OpenAI further noted that it doesn't allow access to its platforms from Russia, but it's easy to subvert that ban with a VPN account». Перевод наш: «OpenAI при этом отметила, что не разрешает доступ к своим платформам из России, хотя обойти этот запрет через VPN несложно». Это пересказ издания, а не страница самой компании. Заметка — публикация The Register об отчёте OpenAI.

Второй разбор — публикация на Хабре от 21 мая 2026 года, автор vaganovelena (Лена Богданова). Про российских продавцов доступа там сказано с оговоркой о счёте: «Иногда наценка скрывается в том, что они округляют токены вверх или берут процент с input-токенов, который OpenAI не берёт. Считай свои деньги, не верь маркетинговым 5%». Разбор — статья о способах оплаты на Хабре.

Как считает GEN202, видно из ответа модели: списывается столько входных и выходных токенов, сколько модель назвала в поле usage, и оба числа приходят к вам тем же ответом, что и текст. Ставка при этом одна на все токены запроса — за миллион токенов по строке каталога.

Через GEN202 всё это работает из России без VPN: программа шлёт запрос на наш адрес, а к разработчику с ним обращается GEN202. Учётной записи у OpenAI, Google, xAI и Anthropic заводить не нужно, карта иностранного банка и перевод в валюте тоже не понадобятся — деньги принимает российский продавец, а расчёты с разработчиками ведёт GEN202.

Обе публикации приведены на 16 сентября 2026 года; это проверки и замеры со стороны, сделанные без GEN202.

Цены, названные на этой странице, — наши: их считает каталог GEN202, а пакеты пополнения собраны на странице цен.