LLM API в России
LLM API в GEN202 — это языковые модели GPT, Gemini, Grok, Claude: они отвечают на вопросы, пишут и правят текст, разбирают документы и картинки, а вызываются в формате OpenAI Chat Completions. Самая низкая ставка входа — 46 ₽ за миллион токенов — до 10% ниже официальной цены. Купить API ключ к нейросети здесь — значит получить один ключ на весь каталог: оплата рублями с российской карты, VPN не нужен. Первый вызов — один запрос с примерами на curl и Python.
Цены на LLM API
Цена за миллион токенов, отдельно за вход и за выход. Списывается фактический расход из поля usage ответа.
| Модель | Поставщик | Скидка от официальной цены | Цена от, за миллион токенов |
|---|---|---|---|
| GPT 5.6 | OpenAI | до −10% | $0.4646 ₽ |
| GPT 6 Astra | OpenAI | $23.082308 ₽ | |
| Gemini 3.6 Flash | $1.73173 ₽ | ||
| Gemini 3.7 Flash | $1.73173 ₽ | ||
| Grok 4.5 | xAI | $4.615461,5 ₽ | |
| Grok 4.6 | xAI | $4.615461,5 ₽ | |
| Claude Opus 5 | Anthropic | $11.541154 ₽ | |
| Claude Sonnet 5 | Anthropic | $4.615461,5 ₽ | |
| Claude Fable 5 | Anthropic | $23.082308 ₽ |
Бренды языковых моделей
Языковые модели каталога сделаны компаниями: OpenAI, Google, xAI, Anthropic.
Какие языковые модели доступны по API
Языковых моделей в каталоге 11 — GPT 5.6 Luna, GPT 5.6 Terra, GPT 5.6 Sol, GPT 6 Astra, Gemini 3.6 Flash, Gemini 3.7 Flash, Grok 4.5, Grok 4.6, Claude Opus 5, Claude Sonnet 5 и Claude Fable 5. Стоят за ними 4 компании: OpenAI, Google, xAI и Anthropic. Счёт у всех идёт за миллион токенов, и самый дешёвый вход в каталоге стоит 46 ₽. Вызываются модели одинаково: имя нужной ставится в поле model, и остальное тело запроса от выбора не зависит.
Различаются модели ценой, размером окна контекста и тем, кто их сделал, — остальное у них общее. Поля запроса, форма ответа и перечень отказов заданы одним адресом на весь текстовый каталог, поэтому переход с одной модели на другую стоит одной строки: имя вида gpt/5-6-luna меняется на соседнее. Во сколько обходится миллион токенов у каждой, показывает таблица цен на её странице.
Часть имён — уровни одного семейства: у GPT 5.6 их 3 — Luna, Terra и Sol. Уровни живут на общей странице, потому что различает их только имя в поле model и ставка, а поля и ответ у них одни и те же; переключаются они там кнопками. Отсюда и счёт страниц: моделей 11, а страниц под ними 9.
| Модель | Имя в поле model | Окно контекста | Вход за миллион | Выход за миллион |
|---|---|---|---|---|
| GPT 5.6 Luna | gpt/5-6-luna | 1 050 000 токенов | 46 ₽ | 277 ₽ |
| GPT 5.6 Terra | gpt/5-6-terra | 1 050 000 токенов | 461,5 ₽ | 2769,5 ₽ |
| GPT 5.6 Sol | gpt/5-6-sol | 1 050 000 токенов | 461,5 ₽ | 2700 ₽ |
| GPT 6 Astra | gpt/6-astra | 1 050 000 токенов | 2308 ₽ | 11540 ₽ |
| Gemini 3.6 Flash | gemini/3-6-flash | 1 000 000 токенов | 173 ₽ | 865,5 ₽ |
| Gemini 3.7 Flash | gemini/3-7-flash | 1 048 576 токенов | 173 ₽ | 865,5 ₽ |
| Grok 4.5 | grok/4-5 | 500 000 токенов | 461,5 ₽ | 1385 ₽ |
| Grok 4.6 | grok/4-6 | 500 000 токенов | 461,5 ₽ | 1385 ₽ |
| Claude Opus 5 | claude/opus-5 | 1 000 000 токенов | 1154 ₽ | 5770 ₽ |
| Claude Sonnet 5 | claude/sonnet-5 | 1 000 000 токенов | 461,5 ₽ | 2308 ₽ |
| Claude Fable 5 | claude/fable-5 | 1 000 000 токенов | 2308 ₽ | 11540 ₽ |
Три числа в таблице — это всё, чем строки расходятся между собой. Окно контекста — предел на то, что уходит в один запрос: и само задание, и приложенные материалы, и вся прошлая переписка. Ставки берутся раздельно, поэтому длинное задание с коротким ответом и короткое задание с длинным ответом обходятся по-разному.
Русский текст дробится на большее число токенов, чем тот же смысл по-английски. Значит, в окно одного размера русского материала помещается меньше, а миллион токенов кончается раньше. Точное число возвращает поле usage в ответе, и мерить длину надёжнее на своих текстах.
Что разработчики пишут о доступе по странам
Россия не названа ни на одной странице разработчиков, которые здесь проверялись. Что у них опубликовано на самом деле — перечень поддерживаемых стран, дата на странице и вводная фраза к перечню — собрано ниже со ссылками.
У OpenAI это документ «Supported countries and territories»: перечень из 208 строк, и строки «Russia» в нём нет. Перед перечнем стоит предупреждение: «Accessing or offering access to our services outside of the countries and territories listed below may result in your account being blocked or suspended». Перевод наш: «Доступ к нашим услугам или предоставление доступа к ним за пределами перечисленных ниже стран и территорий может привести к блокировке или приостановке вашей учётной записи». Страница — перечень стран и территорий OpenAI.
У Google страница названа «Available regions for Google AI Studio and Gemini API», и внизу неё стоит дата «Last updated 2026-04-28 UTC». Сообщение, с которым сюда и приходят, разработчик приводит там же: «Regional restrictions: Google AI Studio is not available in your region». Перевод наш: «Региональные ограничения: Google AI Studio недоступна в вашем регионе». В перечне 230 строк, и «Russia» среди них тоже не стоит. Страница — регионы Gemini API и Google AI Studio.
У xAI про регионы сказано на странице о месте обработки запроса. Написано в ней так: «SpaceXAI may route requests between regions for capacity or reliability, so the processing location is not guaranteed». Перевод наш: «SpaceXAI может перекладывать запросы между регионами ради мощности или надёжности, поэтому место обработки не гарантировано». Страница — региональные точки входа xAI.
Страницы Anthropic о странах 16 сентября 2026 года не проверяли, поэтому её слов здесь нет. Пропуск строки в чужом перечне сам по себе ничего не доказывает: в том же документе OpenAI нет ни Китая, ни Белоруссии, а строка про Украину несёт оговорку прямо в себе — «Ukraine (with certain exceptions)».
Условия трёх разработчиков приведены по их страницам на 16 сентября 2026 года.
Как считают токены у разработчиков и как здесь
Единица счёта у языковых моделей называется одинаково везде, где прайс открывается: миллион токенов, отдельно на вход и отдельно на выход. Отличаются разработчики не единицей, а тем, сколько ставок они разводят внутри неё.
Над таблицей текстовых моделей у OpenAI стоит подпись «Prices per 1M tokens» — перевод наш: «Цены за 1 миллион токенов». Столбцы под ней разведены дальше: «Short context input», «Short context cached input», «Short context cache writes», «Short context output» — то есть у входа, у чтения из кэша, у записи в кэш и у выхода ставки свои, и у каждой из них своя пара значений по длине запроса. Страница — цены OpenAI.
У Google столбец подписан «Paid Tier, per 1M tokens in USD», а строки внутри него названы «Input price», «Output price (including thinking tokens)» и «Context caching price». Перевод наш: «Платный уровень, за 1 миллион токенов в долларах»; «цена входа»; «цена выхода, включая токены размышления»; «цена кэширования контекста». Дата на странице — «Last updated 2026-09-15 UTC». Страница — цены Gemini API.
У xAI столбцы таблицы подписаны «Model | Context | Input / 1M tokens | Cached input / 1M tokens | Output / 1M tokens», а первой строкой над ними стоит оговорка «All prices are in USD» — перевод наш: «все цены в долларах». Единица та же, что у соседей по каталогу, а чтение из кэша вынесено своим столбцом. Страница — цены xAI.
В кредитах GEN202 единица та же: цена назначена за миллион токенов, а ставка входа со ставкой выхода стоят в каталоге разными строками. Сколько токенов списать, решает не наш подсчёт, а фактический расход: он берётся из поля usage ответа модели. Обе ставки по каждой модели собраны таблицей в начале страницы.
Чем вызов LLM отличается от картинок и видео
Ответ приходит на тот же запрос, которым его попросили. У изображения и ролика так не выходит: там сначала ставится задача, а потом её состояние опрашивают до готовности — этот порядок разобран в разделе «Как устроена задача». Языковой модели ждать нечего: готовый текст лежит в теле ответа, и второго обращения не нужно.
Форма запроса и ответа — OpenAI Chat Completions. Адрес один на все текстовые модели: POST https://api.gen202.com/v1/chat/completions, ключ уходит заголовком, на один ключ проходит 60 запросов в минуту. Поля и разбор ответа перечислены в разделе «Текстовые модели».
Написанный клиент переезжает сменой базового адреса, потому что у нас OpenAI совместимый API. Библиотеке OpenAI в настройках задаётся https://api.gen202.com/v1 и наш ключ, после чего прежний вызов чата работает как работал: ни имена полей, ни разбор ответа править не приходится. Так и выходит OpenAI совместимый LLM API в России: код остаётся прежним, меняются в нём базовый адрес и ключ, а расчёты с разработчиком ведёт GEN202.
Как получить API key для LLM и подставить его в код
API key для LLM выпускается в кабинете сразу после входа, и ждать одобрения заявки не приходится. Ключ один на весь каталог: им вызываются и языковые модели, и картиночные, и видеомодели. Имя ключу вы задаёте сами, длиной до 60 знаков, — по нему потом видно, какая программа им пользуется.
Порядок от пустого браузера до первого ответа модели укладывается в шесть шагов.
- Вход. Вход в кабинет идёт через Яндекс либо по разовой ссылке из письма, и своего пароля здесь заводить не надо.
- Кредиты. Новому счёту при первом входе начисляются приветственные кредиты, и первые вызовы оплачиваются ими.
- Выпуск ключа. В кабинете нажимают выпуск ключа и получают строку, которую подставляют в свою программу.
- Базовый адрес. Библиотеке OpenAI базовым адресом задают https://api.gen202.com/v1, а остаток пути до метода она дописывает сама.
- Заголовок доступа. Запрос, собранный руками, несёт ключ в заголовке Authorization по схеме Bearer, а тело помечает типом application/json.
- Первый вызов. В поле model ставят имя нужной строки каталога, в messages кладут сообщение, и текст возвращается тем же запросом.
Первый отказ чаще приходит из-за адреса или строки ключа, а не из-за выбранной модели. Адрес метода отвечает на запрос с телом, и открывать его ссылкой в браузере бесполезно. Лишний пробел по краям скопированного ключа читается как неверный ключ, поэтому строку сверяют целиком.
Базовый адрес пишут целиком и без косой черты на конце: лишняя черта складывается с началом пути и даёт адрес, которого у GEN202 нет. Отказ по доступу тоже не всегда про сам ключ — бывает, что программа не положила его в заголовок. Оба случая разбираются одним приёмом: тот же адрес и тот же ключ отправляют простым запросом из командной строки.
Готовый код обычно несёт поля настройки, которые вписала за вас библиотека. Такие поля принимаются без отказа: до модели доходят имя модели, список сообщений и потолок ответа. Сам потолок принимается под двумя именами, max_tokens и max_completion_tokens, поэтому и его в коде править не надо. Про заголовки запроса подробнее сказано в разделе «Ключ и заголовки».
API для чат-бота: что нужно, чтобы подключить
Боту нужно ровно то же, что разовому вызову: тот же ключ и тот же базовый адрес. Отдельного согласования под бота не предусмотрено, и той же строкой ключа вызывается любая модель каталога.
Сама переписка лежит в поле messages — списком сообщений, у каждого своя роль. В system пишут указание боту, в user — реплику собеседника, в assistant — прошлые ответы модели. Между запросами GEN202 ничего не помнит: модель видит ровно то, что вы положили в messages, поэтому историю разговора собирает сам бот, и с каждым запросом она отправляется заново.
Длину ответа просят полем max_tokens: целое от 1 до 128 000, а запрос без него считается просьбой на 1 024. Убедиться, что ключ и адрес работают, можно до первой строки кода — в песочнице на странице модели: она отправляет тот самый запрос, который будет слать ваш бот, и показывает, во что он обошёлся.
- Расход у бота растёт по ходу беседы сам: каждая новая реплика уносит с собой все предыдущие.
- Указание в роли system отправляется в каждом запросе, поэтому короткое указание обходится дешевле длинного.
- Под новую тему выгоднее начать разговор заново: подрезанная история оборачивается переспрашиванием, и одна работа оплачивается дважды.
Сколько сообщений держать в переписке, решает сам бот, а предел ему ставит окно контекста выбранной модели. Когда история перестаёт помещаться, старые реплики либо убирают из списка, либо заменяют одним пересказом.
Сколько стоит миллион токенов и как считается расход
Платят за токены, а не за запросы, и ставок у модели две — на вход и на выход. Дешевле всего вход у GPT 5.6 Luna: 92 кредита за миллион токенов, это 46 ₽. Дороже всего выход у GPT 6 Astra — 23080 кредитов, или 11540 ₽. Выход стоит дороже входа у каждой модели каталога, а обе ставки сразу стоят таблицей выше.
Счёт выставляется по факту. Вместе с ответом приходит поле usage, в нём стоит число прочитанных и написанных токенов, и списывается ровно то, что там названо. Запрошенный потолок ответа на сумму не влияет: платят за токены, которые модель действительно прочитала и написала.
До ответа часть кредитов резервируется на балансе. Под вход удержание считается по длине отправленных сообщений, а под выход откладывается не меньше чем 4 000 токенов — больше, чем подставляется в max_tokens без вашей просьбы, потому что модели этот потолок соблюдают не всегда. Когда ответ разобран, лишнее удержание тем же запросом возвращается на баланс, а обращение, оборвавшееся на стороне модели, денег не стоит. Сколько ушло на каждый вызов, видно в кабинете, а из своей программы тот же расход спрашивается способом из раздела «Баланс и расход».
- Удержание. Перед обращением к модели часть кредитов замирает на счёте: свободный остаток уменьшается, а сам баланс стоит на месте.
- Оценка. Под вход откладывают по длине отправленных сообщений, а под ответ — по нижней границе GEN202.
- Вызов. Запрос уходит модели, и до её ответа отложенная сумма остаётся отложенной.
- Счёт. Из ответа берут поле usage и списывают ровно те токены, которые модель прочитала и написала.
- Возврат. Разницу между отложенным и потраченным возвращают на счёт тем же запросом.
Тесно поставленный потолок ответа не делает вызов дешевле. Часть работы модель пишет для себя, и эти токены считаются написанными наравне с видимым текстом. При слишком низком потолке видимого текста может не остаться вовсе, хотя токены уже потрачены.
Что именно считается токенами, разработчик перечисляет прямо: «Input tokens: Your query and conversation history. Reasoning tokens: Agent's internal thinking and planning. Completion tokens: The final response». Перевод наш: «Входные токены: ваш запрос и история переписки. Токены рассуждения: внутреннее обдумывание и планирование агента. Токены ответа: итоговый ответ». Перечень стоит на странице цен xAI, снятой 16 сентября 2026 года.
Разрыв между двумя ставками объясняется устройством работы, а не наценкой продавца. Отправленное модель прочитывает разом, а ответ выдаёт по одному куску, и каждый следующий кусок обходится ей дороже.
Что приходит в ответе на вызов текстовой модели
Ответ приходит одним объектом. Текст модели лежит в списке choices — в поле message.content его первого элемента. Рядом стоит finish_reason, и по нему видно, ответ закончился сам или упёрся в запрошенный потолок.
Второе поле, ради которого ответ разбирают, — usage. В нём три числа: prompt_tokens за прочитанное моделью, completion_tokens за написанное ею и total_tokens за оба вместе. Счёт выставляется по ним, поэтому цена вызова известна из того же ответа, что и текст.
Из программы это выглядит не так, как в чате браузера. В чате ответ печатается на экран, а здесь его разбирает ваш код: ни кнопок, ни настроек у вызова нет. Всё, чем в чате управляют мышью, здесь стоит полями тела запроса.
| Поле ответа | Что в нём лежит |
|---|---|
| choices[0].message.content | Текст, который написала модель. |
| choices[0].finish_reason | Причина остановки: stop — закончила сама, length — упёрлась в потолок. |
| usage.prompt_tokens | Сколько токенов модель прочитала. |
| usage.completion_tokens | Сколько токенов модель написала. |
| usage.total_tokens | Оба числа вместе. |
На вид оборванный ответ не отличается от законченного, поэтому поле причины смотрят и тогда, когда текст кажется целым. Дописывают такой ответ вторым вызовом, отправив в него уже полученную часть.
Есть ли бесплатные API нейросетей
Бесплатные API нейросетей у нас устроены так: ключ и доступ к каталогу ничего не стоят, а плата берётся за прошедшие через модель токены. Попробовать текстовую модель можно ещё до входа: бесплатный запрос даётся 1 раз в сутки. Отвечает на него gpt/5-6-luna, ответ доходит до 512 токенов, а сообщение принимается длиной до 500 символов.
Дальше идут приветственные кредиты: при первом входе на счёт кладётся 50 кредитов. Ими оплачиваются вызовы по обычной цене каталога, и ни выбор модели, ни длина ответа уже не ограничены. Списываются они так же, как купленные, — по числам из поля usage.
Когда приветственные кредиты кончились, работа идёт с баланса: каждый вызов мы оплачиваем разработчику модели, и счёт считается по фактическому расходу. Пополняется баланс рублями, готовыми пакетами на странице цен.
Что приходит при отказе
При отказе вместо текста приходит объект error, и внутри него лежат сообщение, тип и код. Форма та же, что у OpenAI, поэтому готовый клиент разбирает такой ответ сам. Таблица кодов с пояснением к каждому собрана в разделе «Отказы».
Часть отказов GEN202 даёт до обращения к разработчику: неверный ключ, нехватка свободных кредитов, поле запроса вне допустимых границ. Такой ответ не стоит ничего — кредиты за него не списываются. Сюда же относится превышение частоты: сверх названного выше потолка запросы не проходят.
Вторая половина отказов приходит со стороны модели: модель не ответила или запрос отклонён по её загрузке. Тогда удержание снимается целиком и вызов не тарифицируется, а повторить его можно через несколько секунд.
| Ответ | Что произошло | Когда повторять |
|---|---|---|
| 400 | Тело не прочиталось, имя модели незнакомо либо поле вышло за границы. | После правки запроса |
| 401 | Ключ не назван в заголовке, неверен или отключён. | После проверки ключа |
| 402 | Свободных кредитов меньше, чем удерживается под этот вызов. | После пополнения |
| 413 | Тело запроса переросло предел в 512 КиБ. | После правки запроса |
| 415 | В заголовке типа содержимого не назван application/json. | После правки заголовка |
| 429 | С одного ключа за минуту ушло больше 60 вызовов. | Через минуту |
| 502 | Ответ модели не разобрался или запрос до неё не дошёл. | Сразу |
| 503 | Модель перегружена или сработал её лимит. | По сроку из Retry-After |
Повторять имеет смысл не всякий отказ, и число ответа говорит, какой это случай. Деньги, разбор запроса и загрузка модели разведены по разным числам, поэтому причину не приходится искать перебором. На перегрузке срок повтора назван заголовком Retry-After, и клиентские библиотеки выдерживают эту паузу сами.
Потолок частоты у нас считается вызовами с одного ключа за минуту, а не объёмом отправленного текста. Поэтому один длинный запрос его в одиночку не выбирает.
Что показали независимые разборы доступа
Прямая формулировка про доступ из России нашлась не у разработчика, а в заметке издания The Register от 25 августа 2026 года, автор Brandon Vigliarolo. Издание пересказывает отчёт OpenAI и пишет: «OpenAI further noted that it doesn't allow access to its platforms from Russia, but it's easy to subvert that ban with a VPN account». Перевод наш: «OpenAI при этом отметила, что не разрешает доступ к своим платформам из России, хотя обойти этот запрет через VPN несложно». Это пересказ издания, а не страница самой компании. Заметка — публикация The Register об отчёте OpenAI.
Второй разбор — публикация на Хабре от 21 мая 2026 года, автор vaganovelena (Лена Богданова). Про российских продавцов доступа там сказано с оговоркой о счёте: «Иногда наценка скрывается в том, что они округляют токены вверх или берут процент с input-токенов, который OpenAI не берёт. Считай свои деньги, не верь маркетинговым 5%». Разбор — статья о способах оплаты на Хабре.
Как считает GEN202, видно из ответа модели: списывается столько входных и выходных токенов, сколько модель назвала в поле usage, и оба числа приходят к вам тем же ответом, что и текст. Ставка при этом одна на все токены запроса — за миллион токенов по строке каталога.
Через GEN202 всё это работает из России без VPN: программа шлёт запрос на наш адрес, а к разработчику с ним обращается GEN202. Учётной записи у OpenAI, Google, xAI и Anthropic заводить не нужно, карта иностранного банка и перевод в валюте тоже не понадобятся — деньги принимает российский продавец, а расчёты с разработчиками ведёт GEN202.
Обе публикации приведены на 16 сентября 2026 года; это проверки и замеры со стороны, сделанные без GEN202.
Цены, названные на этой странице, — наши: их считает каталог GEN202, а пакеты пополнения собраны на странице цен.