
До недавнего времени я работал в основном на MiniMax M3, и в одном смысле эта модель меня избаловала: огромные лимиты за смешные деньги, и я ни в чём себя не ограничивал. GLM от Z.AI я подключил ради эксперимента – взял начальный, самый дешёвый Coding Plan, просто посмотреть, как ведёт себя эта модель на моих задачах. К вечеру первого дня мой недельный лимит иссяк, но я уже был буквально очарован стилем работы этой модели – она работала предельно чётко, без рассюсюкиваний, с минимумом ошибок, да ещё и решая между делом накопившиеся проблемы: нашла и закрыла бэкдор в моём блоге, открытый с 2019(!) года, исправила ошибку MCP-сервера, из-за которой генерация картинок у меня время от времени падала, навела порядок в моей wiki-библиотеке, рассортировав 250+ статей и так далее.
Я понял, что нам с ней по пути, пересел на тариф дороже и впервые за несколько месяцев задумался об экономии: я ведь привык жечь токены в огромных количествах – эксперименты, работа с большими документами, подготовка материалов для семинаров и книг, – всё это очень затратные для LLM задачи, и прежняя модель спокойно выдерживала этот стиль. Возвращаться назад уже не хочется: GLM заметно умнее, и для моих задач эта разница имеет значение.
Пара слов, чтобы дальнейшее было понятнее: в повседневной работе я стремлюсь выбирать модели с лучшим соотношением интеллекта и цены. Топовый интеллект без оглядки на деньги нужен далеко не всегда – для большинства моих задач имеет смысл искать именно баланс. Американские модели по чистому интеллекту сегодня сильнее китайских, но я предпочитаю те, что работают без VPN и без совсем уж оголтелой цензуры, – а это сужает выбор до китайского сегмента и открытых моделей – и GLM сейчас одна из лучших среди них.
GLM – это, по сути, две модели на выбор. 14 августа 2026 года вышла GLM-5.3 – флагманская модель с 743 миллиардами параметров, из которых на каждый запрос работает около 40 миллиардов. Через двенадцать дней появилась GLM-5.3-Flash: 320 миллиардов параметров, 18 активных, тот же контекст в миллион токенов. Миллион входных токенов стоит $1,40 у флагмана и $0,15 у Flash, а миллион выходных – $4,40 против $0,50 – Flash обходится в девять раз дешевле при близких к флагману показателях.
В общем, я решил выяснить, насколько они близки, реально ли сэкономить, используя Flash-модель и все прочие доступные возможности, и если да, то за счёт чего. Забегая вперёд, скажу, что да, я нашёл подходящие мне способы уменьшить расход токенов, но у них оказались подводные камни, о которых вам следует знать, если вы вслед за мной захотите подключить модель с великолепным интеллектом за вменяемые деньги.
Подписка и счастливые часы
Первое и самое очевидное: оптом дешевле. У GLM есть месячная подписка – Coding Plan, который даёт скидку на цену токена по сравнению с розницей. На Pro-тарифе за $80 в месяц пользователю выдаётся лимит в 60 000 кредитов в неделю, который расходуется с учётом используемых моделей, дней недели и конкретных часов работы: в выходные и непиковые часы списывается вдвое меньше. Если пересчитать кредиты обратно в доллары за миллион токенов, получается такая картина:
| Токен | Розница, $/M | План днём, $/M | План ночью, $/M |
|---|---|---|---|
| GLM-5.3, вход | 1,40 | 0,21 (в 6,6 раза) | 0,11 (в 13 раз) |
| GLM-5.3, выход | 4,40 | 0,74 (в 6 раз) | 0,37 (в 12 раз) |
| Flash, вход | 0,15 | 0,07 (в 2,1 раза) | 0,035 (в 4,3 раза) |
| Flash, выход | 0,50 | 0,25 (в 2 раза) | 0,12 (в 4,1 раза) |
В любые часы, кроме 09:00–13:00 по московскому времени в будние дни, план списывает половину кредитов, поэтому флагману подписка даёт от шестикратной до тринадцатикратной скидки на розничный токен, Flash – от двукратной до четырёхкратной. Подписка однозначно выгоднее розницы – даже пиковая цена Flash в подписке вдвое ниже розничной, – поэтому дальше все расчёты я буду делать, отталкиваясь от неё.
Но есть важный момент – разница цен между моделями внутри подписки сглаживается: вместо девяти раз остаётся ровно три, уже не так впечатляюще, как хотелось бы.
Сколько стоит подумать
Режим reasoning у GLM-5.3 не выключается ни в одной из версий, а токены размышления тарифицируются как выходные. Это значит, что уровень reasoning сильно влияет на расход токенов.
У обеих моделей четыре уровня reasoning: low, medium, high и max. Официальная документация описывает только три из них – про medium Z.AI не пишет нигде, – но API его принимает и честно отрабатывает: на этом уровне модель думает на порядок короче, чем на high, и счёт за размышления падает заметно.
Посчитаем типичную агентную задачу – 20 тысяч токенов контекста на входе, 2 тысячи ответа, плюс размышления по уровню – в кредитах подписки:
| Уровень | GLM-5.3 | Flash |
|---|---|---|
| low | 19,1 | 6,4 |
| medium | 19,9 | 6,6 |
| high | 30,4 | 10,1 |
| max | 33,6 | 11,2 |
Тройная разница сохраняется на любом уровне, а переключение low → max у одной и той же модели удорожает задачу в 1,7–1,8 раза: выбор модели весит в пять раз больше, чем выбор уровня размышления.
Ступени интеллекта
Экономия в три раза хороша, только если задачи при этом решаются одинаково. Единственная площадка, где опубликованы уровни обеих моделей, – собственный бенчмарк Z.AI по кодингу: приватный, с защитой от утечек заданий в тестовые множества, поэтому цифры вендорские. Сводя всё, что известно об интеллекте моделей по режимам, получаем такую лестницу (процент завершения задач на Code Bench):
| Уровень | GLM-5.3 | Flash |
|---|---|---|
| low | ≈26* | ≈20* |
| medium | ≈29* | ≈23* |
| high | 31,4 | ≈26* |
| max | 34,5 | 29,0 |
* Звёздкой помечены оценочные данные, полученные экстраполяцией опубликованных замеров.
Получается, что Flash в режиме max даёт такие же результаты, что и GLM-5.3 в режиме medium, но почти в два раза дешевле. В два. Не в три и, тем более, не в девять. Всё равно неплохо, но есть ли у такой экономии ещё какие-то подводные камни? Ну разумеется, есть.
Но прежде, чем мы двинемся дальше, хочу обратить ваше внимание на то, что GLM-5.3 в режиме low reasoning это, пожалуй, худший из всех вариантов: слабый и при этом дорогой. Если нужно делать много тупеньких задач – лучше использовать Flash high или medium, а для чего-то интеллектуального – GLM-5.3 в режимах high или max.
Размышление ест контекст
У экономии на Flash есть неприятный нюанс: токены размышления живут в том же контекстном окне, что и полезная работа. На короткой задаче это незаметно, но на длинной агентской сессии окно контекста заполняется быстрее и агенту чаще приходится его компактифицировать. GLM-5.3 в medium думает сотней токенов на простой задаче, а Flash в max – тысячами и десятками тысяч; по данным Artificial Analysis, за одну тяжёлую задачу она может потратить на размышления под 47 тысяч токенов.
Компактификация – дорогое удовольствие. Модели нужно перечитать весь накопленный контекст и сгенерировать саммари – это отдельный, совсем не маленький вызов. При типичном пороге компактификации в 800 тысяч токенов стоит Flash около 216 кредитов (800 тысяч входа плюс 40 тысяч на само резюме по её мультипликаторам), а флагману – 648. Но размышления Flash заполняют контекст в разы быстрее: порог в 800 тысяч накапливается уже за 70–80 шагов и более частые компактификации постепенно съедают всю экономию. Хуже того, потерянные при сжатии контекста детали снижают качество работы модели с каждым циклом.
Соответственно, Flash позволяет экономить на задачах, которые решаются за несколько десятков шагов: точечные правки, вопросы по коду, генерация и рефакторинг отдельных модулей, батч-прогоны документов, обработка списков – всё, что укладывается в один контекст без сжатия. Длинные сессии выгоднее вести на GLM-5.3 в medium – она думает мало, контекст растёт только от реальной работы и качество не падает.
GLM Flash в режиме low я использовать не рекомендую вообще. Без размышлений она становится тупой, как пробка, и вся прелесть работы с ней теряется. По моим ощущениям, в этом режиме она сильно уступает Minimax M3 и по интеллекту, и по цене.
Цена экономии – время
Ещё один подвох – скорость работы моделей, и здесь картина оказалась сложнее, чем я ожидал.
По замеру Artificial Analysis на публичном API Z.AI дешёвая модель быстрее флагмана: Flash выдаёт около 107 токенов в секунду против 72 у GLM-5.3, первый токен приходит через 2,3 секунды против 2,9. На эталонной тяжёлой задаче лаборатории Flash в max укладывается за девять минут, флагман в max – за тринадцать.
Но это публичный API с оплатой за токены. Для подписчиков Coding Plan реальная картина может оказаться другой – и мой собственный замер это подтверждает. Вечером в пятницу, на эндпоинте подписки, флагман стабильно выдавал около 50 токенов в секунду на любом уровне размышления, а Flash в max – всего 28.
К тому же замеры от friendli.ai на трёх бенчмарках показали, что Flash тратит на 12–45% больше ходов на задачу, чем флагман: дешёвая модель компенсирует меньший интеллект перебором: чаще ошибается и сама себя исправляет, тратя время и токены.
Получается, что Flash – вовсе не flash, а cheap. Она вовсе не быстрая (скорее, наоборот), а просто более дешёвая. Использовать её имеет смысл, когда такая модель делает что-то автономно или параллельно, не задерживая человека, рабочее время которого стоит дорого.
Оптимальный сценарий
В итоге, чтобы реально экономить с моделью GLM, нужно придерживаться следующей стратегии:
- Использовать подписку, а не оплату за токены. Для ежедневного использования это самый сильный источник экономии (от 2 до 6 раз).
- Не использовать модель с 9:00 до 13:00 без острой необходимости – это даст экономию ещё в 2 раза.
- В качестве основной модели использовать Flash в режиме max – это золотая середина по цене/качеству (ещё почти 2 раза).
- Следить, чтобы задачи Flash max не выходили за пределы контекстного окна и не требовали компактификации.
- Простые задачи делегировать Flash medium, сложные – 5.3 max.
Чтобы пользоваться искусственным интеллектом эффективно, иногда полезно включать собствееный интеллект. Ну и, разумеется, разбираться в ИИ хотя бы на базовом уровне.
Друзья, подписывайтесь на мой Твиттер (там я пишу чаще) и Телеграм, чтобы получать анонсы новых материалов.








Комментариев: 0