OM Oleksandr Moccogni
Публикации /Новости ·2026 ·12 min read

GLM 5.3: лучшая открытая LLM вышла на первое место, ничего не меняя

GLM 5.3: лучшая открытая LLM прямо сейчас. Z.ai выпустила её, не тронув архитектуру: та же модель 744B, более долгий пост-тренинг. Что это значит для вас.

Oleksandr Moccogni

GLM 5.3: лучшая открытая LLM вышла на первое место, ничего не меняя

Самая важная AI-модель августа не получила новый мозг. GLM 5.3, лучшая открытая LLM, которую сейчас можно арендовать, вообще не новая модель.

Ключевые выводы

TL;DR GLM 5.3, урок пост-тренинга
01 GLM 5.3: новая модель Z.ai и самая сильная модель с открытыми весами, которую сейчас можно арендовать. Она обходит Kimi K3 на многих бенчмарках и борется с Claude Fable 5 до статистической ничьей в реальном программировании.
02 Архитектура не изменилась. Та же базовая модель, что у GLM 5.2, те же слои внимания, те же 744B параметров. Слова самой Z.ai: «Всё, что мы сделали для GLM-5.3, это масштабировали пост-тренинг».
03 Модель на 744B, обгоняющая Kimi K3 на 2.8T, означает одно: более крупная модель была недообучена. Запас в пост-тренинге и есть место, где живут приросты следующего года.
04 DeepSeek провернула тот же ход двумя неделями ранее: V4 Flash 0731 сохранила идентичную архитектуру 284B и была лишь заново пост-тренирована, с заметным приростом. Это паттерн, а не случайность.
05 Для всех, кто строит на AI: возможности фронтир-класса за $1.40 за миллион входных токенов переписывают вашу юнит-экономику. Планируйте под дешёвые, быстрые, близкие к открытым модели. Эта разница и есть ваша маржа.

Я зарабатываю на жизнь системами AI-маркетинга, и кодинг-агент, живущий в моём терминале, работает на GLM 5.3. Он собирает лендинги, рефакторит код трекинга и двигает 3D-объекты в Blender через агентный мост, пока я пью кофе. Год назад это было демо. Теперь это обычный вторник.

Вот часть, которую никто не выносит в заголовок. GLM 5.3 не новая модель. Это та же модель, что GLM 5.2, просто обучавшаяся дольше. Та же архитектура. Те же слои внимания. Те же 744 миллиарда параметров. Z.ai не изобрела ничего нового, чтобы сюда попасть. Они просто отказались останавливать обучение.

Эта деталь и есть вся история текущего момента в гонке ИИ. Проведу вас по тому, что произошло, с проверкой по первоисточникам, и по тому, что это значит для ландшафта открытого ИИ, если вы строите на этих моделях, как я.

Маленький глиняный робот с лаймовыми акцентами поднимает огромную светящуюся штангу, пока колоссальный серый робот изнеможённо сидит на скамье

Что такое GLM 5.3 на самом деле

14 августа 2026 года Z.ai (компания за спиной Zhipu AI) выпустила GLM 5.3, свою новую фронтирную модель для кодинга. Заявления, по большей части подтверждённые независимым анализом:

  • Самая способная модель с открытыми весами для кодинга, с приростом 50% над GLM 5.2 на внутреннем Code Bench самой Z.ai.
  • Она обходит Kimi K3 на многих бенчмарках, и, по анализу Interconnects, проходит Claude Fable 5 или GPT-5.6-Sol на некоторых, выходя на самый край фронтира агентного кодинга.
  • Она быстрая: Artificial Analysis замеряет GLM 5.3 примерно на 93 токена в секунду против 39 у Kimi K3.
  • Она дешёвая: $1.40 за миллион входных токенов и $4.40 за миллион выходных на API Z.ai. Claude Fable 5 при тех же объёмах стоит $10 и $50.

Перечитайте эти цены, потому что это тихая бомба. Качество уровня фронтира примерно в 7 раз дешевле на входе и в 11 раз дешевле на выходе, чем флагман Anthropic.

Если вы гоняете агентные сценарии, где одна задача сжигает миллион токенов, это не скидка. Это другая бизнес-модель.

Заметка для честности, потому что я проверяю такие вещи. На момент написания собственные веса GLM 5.3 всё ещё ожидались на Hugging Face, а новейшие репозитории zai-org останавливались на более ранних версиях GLM. Z.ai позиционирует модель как свою линейку с открытыми весами, и выкладку обещали примерно через две недели после релиза. Считайте «открытость» направлением и проверяйте веса, прежде чем строить план самостоятельного хостинга.

GLM 5.3 против Fable 5: честные цифры

Не обязательно верить маркетингу Z.ai на слово. Together AI прогнала обе модели через DeepSWE, реальный бенчмарк программной инженерии: 904 агентных прогона, по 452 на модель. это ближайший аналог фотографии того, где на самом деле находится фронтир.

Pass@1, официальный результат с первой попытки: GLM 5.3 решает 69.0% задач, Fable 5 решает 69.7%. Разрыв укладывается в полосу статистического шума. На реальной работе это ничья.

Дайте каждой модели больше попыток, и GLM выходит вперёд: Pass@2: 81.1% против 77.1%, Pass@4: 87.6% против 84.1%.

Теперь денежная строка. Стоимость прогона: $3.99 против $21.63. На каждые потраченные 100 долларов GLM 5.3 выдаёт 17 решённых задач. Fable 5 выдаёт 3.

Инфографика со столбчатой диаграммой, сравнивающая GLM 5.3 и Claude Fable 5 на DeepSWE: показатели почти равны, решённых задач на 100 долларов 17 против 3

Где Fable 5 всё ещё выигрывает? Бенчмарки на фронтирных обвязках: 39.5% против 34.5% на том же Code Bench Z.ai при максимальных усилиях, и уверенный отрыв на длинных задачах безопасности ExploitGym. Ещё Rust, где Fable впереди со счётом 85% против 70%. Если ваша нагрузка это Rust и тяжёлая сериализация, платите за фронтир.

Идея маршрутизации, самый практичный бриллиант во всех этих данных. Сначала гоняйте GLM, эскалируйте на Fable только при провале, и получите точность 81.1% при $10.74 за задачу. Это бьёт Fable в одиночку, которая даёт 69.7% точности за $21.63. Лучше по обеим осям, за половину стоимости. Большинство команд, работающих на фронтирных моделях, никогда не делали этот расчёт.

Тот же мозг, более долгий тренинг: признание, которое имеет значение

Самое интересное предложение этого релиза не на графике бенчмарка. Оно в собственном описании модели от Z.ai:

«Всё, что мы сделали для GLM-5.3, это масштабировали пост-тренинг».

Прочувствуйте это. Ментальная модель прогресса в индустрии устроена так: новая архитектура, модель больше, модель умнее. Каждый скачок способностей обязан приходить с новой цифрой на коробке и свежей научной работой.

GLM 5.3 говорит: нет. Базовая модель идентична GLM 5.2. Количество параметров не сдвинулось: около 744B параметров суммарно, архитектура Mixture-of-Experts с примерно 40B активными на токен, унаследованная от базы GLM-5. Изменился пост-тренинг: больше сред, более разнообразные задачи и тяжёлые вычисления, потраченные на практику против реальных задач. Та самая практика, которую нельзя подделать, копируя ответы большей модели.

Простыми словами: они взяли тот же мозг и дали ему годы осознанной практики вместо большего черепа.

И эту практику можно измерить, потому что в сравнениях к запуску обе версии опубликованы на одних и тех же бенчмарках:

  • Terminal-Bench 3.0: с 4.6 до 28.3.
  • SWE-Marathon v1.1: с 19.4 до 42.5.
  • DeepSWE v1.1: с 46.2 до 66.9.

Инфографика показывает скачок от GLM 5.2 к GLM 5.3 на трёх бенчмарках: короткие серые столбцы превращаются в длинные лаймовые

Эти числа породила не новая архитектура. Их породила осознанная практика.

Сам прирост Interconnects охарактеризовал как «в известной мере ошеломляющий». И ритм значит не меньше, чем сами баллы. Пока западные лаборатории тратят время между релизами на закрытое тестирование, китайские лаборатории выпускают за дни, а не за месяцы, и используют каждый из этих дней, чтобы подниматься выше.

Парадокс размера: 744B обгоняет 2.8T

Здесь я надеваю шляпу аналитика, потому что числа рассказывают некомфортную историю.

МодельЛабораторияВсего параметровПримечания
GLM 5.3Z.ai~744B (40B активных)Обходит Kimi K3 ниже по многим бенчмаркам
Kimi K3Moonshot AI~2.8T (896 экспертов)Нативная мультимодальность, контекст 1M
Qwen3.8-MaxAlibaba~2.4T (95B активных)Первые открытые веса модели класса Max
DeepSeek V4 Flash 0731DeepSeek284B (13B активных)Только повторный пост-тренинг, заметный скачок

Модель на 744B, обгоняющая модель на 2.8 триллиона параметров, это не погрешность округления. Это диагноз.

Крошечный лаймовый робот стоит на самом высоком пьедестале и держит светящийся трофей, два колоссальных серых робота осели на куда более низких пьедесталах рядом

Сначала оговорка: Kimi K3 тратит ёмкость на нативную мультимодальную работу, которую кодинговые бенчмарки не оценивают. Даже с учётом этого сигнала невозможно не заметить. Если модель почти в четыре раза меньше выигрывает на бенчмарках, где соревнуются обе, значит, большая модель была недообучена. Моё прочтение: Kimi K3 не глупа. Она не закончена.

У её архитектуры больше сырой ёмкости, чем у GLM 5.3. Разрыв в бенчмарках измеряет, сколько пост-тренинга всё ещё лежит на столе, не потраченное. Моя ставка: когда Moonshot завершит серьёзный пост-тренинг на той же базе, графики снова перевернутся.

Это переформатирует весь разговор о том, «кто впереди». Вопрос никогда не был в том, «чья архитектура победит». Вопрос в том, «кто выжал больше способностей из каждого параметра». Прямо сейчас, среди открытых моделей, этот ответ: Z.ai, и с большим отрывом.

Это случилось дважды: DeepSeek провернула тот же ход

Если бы GLM 5.3 была единственной точкой данных, я бы назвал это разовым случаем. Это не так. Прочитайте официальный changelog API DeepSeek для V4-Flash-0731, выпущенной двумя неделями ранее:

«DeepSeek-V4-Flash-0731 сохраняет ту же архитектуру и размер модели, что и DeepSeek-V4-Flash-Preview, и была только заново пост-тренирована».

Две идентичные тёмные лаборатории бок о бок, в каждой один и тот же маленький глиняный робот нажимает одну и ту же огромную светящуюся лаймовую кнопку

То же предложение. Та же ставка. Две разные лаборатории, с разницей в две недели, пришли к одному выводу: архитектура устоялась, обучение ещё нет.

DeepSeek сохранила идентичную модель на 284B, 13B активных, и заново прогнала её через пост-тренинг. Прирост был значительным. The New Stack описала это как случай, когда меньшая модель обгоняет собственный флагман.

Это, как я это читаю, паттерн китайских лабораторий. Один раз выбрать самую экономную по параметрам архитектуру, а затем масштабировать производительность двумя ручками: больше пост-тренинга на текущей модели или большая модель, которая сразу получает тот же пост-тренинг.

Одна ручка дешёвая и быстрая. Другая медленная и дорогая. Они крутят обе.

Что значит гонка лучших открытых LLM, если вы реально используете ИИ

Вот как GLM 5.3 ложится на мой стол человеку, который планирует маркетинговые системы поверх этих моделей.

Ваша стоимость за задачу рухнула

Агентные сценарии пожирают токены. Контентный пайплайн с этапами ресёрча, драфтов, QA и публикации может сжигать миллионы токенов в неделю. По ценам Fable 5 это реальные деньги.

При $1.40/$4.40 тот же пайплайн стоит долю от этого, при качестве, которое для многих задач уже взаимозаменяемо. Пересчитайте свои цифры. Воркфлоу, который в прошлом квартале был «слишком дорогим для автоматизации», в этом квартале может стать вашей маржой. (Если нужна более полная рамка, я писал о том, почему проекты AI-маркетинга проваливаются, и разрыв редко бывает в модели.)

Хватит жениться на вендорах, начинайте бенчмаркить свои задачи

Когда скачки способностей приходят через пост-тренинг каждые несколько недель, сегодняшний победитель это база следующего месяца. Единственный бенчмарк, который оплачивает ваши счета, тот, что вы запускаете на собственной нагрузке.

Соберите маленький eval-набор: двадцать реальных задач из вашего пайплайна, оценённых человеком. Прогоняйте каждую новую модель через него. Это занимает полдня и превращает хайп в таблицу.

Открытые веса: аргумент в закупках, а не религия

Вы не будете селф-хостить MoE на 744B на запасном сервере. Но модели, близкие к открытым, меняют переговорную позицию. Опция уйти, дообучить или запустить за собственным файрволом и есть то, что тянет цены закрытых моделей вниз.

Волна открытого ИИ, включая веса Qwen3.8-Max, это причина, по которой фронтирные API продолжают дешеветь. Вы выигрываете от самой опции, даже если никогда ей не воспользуетесь.

Ритм способностей теперь недельный, стройте слоями

Я недавно писал о том, как OpenAI жмёт на тормоза ради безопасности. Положите две истории рядом, и паттерн очевиден: западные фронтирные лаборатории замедляются ради тестов, китайские лаборатории выпускают.

Так что перестаньте строить стратегию вокруг одного следующего релиза. Разложите её на три слоя: стабильный слой (модель, которой вы доверяете сегодня), дешёвый слой (класс open-weights для массовой работы) и экспериментальный слой (что бы ни вышло на этой неделе). Пусть слои движутся независимо.

Часто задаваемые вопросы

GLM 5.3 действительно open source?

Z.ai позиционирует GLM 5.3 как свою линейку с открытыми весами, и веса семейства GLM исторически появлялись на Hugging Face. На момент написания собственные веса GLM 5.3 всё ещё ожидались, их обещали примерно через две недели после запуска 14 августа. «Открытость» это заявленное направление компании для этой модели. Проверьте Hugging Face, прежде чем планировать вокруг неё самостоятельный хостинг.

Как GLM 5.3 смотрится на фоне Claude?

На бенчмарках агентного кодинга GLM 5.3 проходит Claude Fable 5 на одних тестах и отстаёт на других. По цене она радикально дешевле: $1.40/$4.40 за миллион токенов против $10/$50 у Fable 5. Моё рабочее правило: закрытые фронтирные модели для самых сложных 10% задач, модели класса GLM для массовой работы, где разница в качестве невидима, а разница в цене видна отлично.

Что такое пост-тренинг в LLM?

Всё, что происходит после того, как базовая модель закончила предобучение: обучение с учителем (SFT), RLHF и RL на верифицируемых задачах вроде кода и математики. GLM 5.3 сохранила базу, идентичную GLM 5.2, и агрессивно масштабировала именно эту фазу. Это дешевле, чем обучать новую архитектуру с нуля, и именно здесь сейчас появляется большинство измеримых приростов способностей.

Мой итог: практика бьёт архитектуру

Лучшая открытая LLM этого момента построена тем, что ничего не меняли. Никакой новой архитектуры. Никакой модели побольше. Только дисциплина продолжать обучать ту, что уже есть, пока все остальные начинали с нуля.

Нахожу это воодушевляющим, и не только для исследований ИИ. Это говорит, что фронтир не зарезервирован исключительно за тем, у кого самый большой тренировочный кластер. Осознанная практика работает и на машинах. Это ещё говорит, что гиганты, которых мы считали законченными, включая Kimi K3, сидят на непотраченном потенциале, и лаборатории, которые продолжают пост-тренинг, продолжат его собирать.

Для тех из нас, кто строит бизнес на этих моделях, пункты действия скучные и прибыльные. Пересчитайте свою токен-экономику. Соберите собственный eval-набор. Проектируйте под мир, где почти фронтирная модель появляется каждую неделю за долю цены.

Команды, которые усвоят этот ритм, будут воспринимать каждый релиз вроде GLM 5.3 так же, как я: как обычный вторник.

Если хотите помощи с переносом этого на ваш маркетинговый стек, напишите мне. Без хайпа. Только то, что говорят цифры.

Теги: GLM 5.3лучшая открытая LLMоткрытые модели ИИпост-тренинггонка ИИ
Все публикации
Oleksandr Moccogni
Автор

Oleksandr Moccogni

Руководитель маркетинга в SSI Schäfer Switzerland и основатель Moccogni Consulting. Я пишу, опираясь на 15+ лет управления ростом мировых брендов, где данные, ИИ и маркетинг действительно встречаются.

Продолжить чтение

Все публикации ↗
ChatGPT в маркетинге: 7 неудобных истин, о которых молчат списки промптовAI и маркетинг
Aug 2026

ChatGPT в маркетинге: 7 неудобных истин, о которых молчат списки промптов

Использование AI в маркетинге: чему меня научили два с половиной года ежедневной работыAI и маркетинг
Aug 2026

Использование AI в маркетинге: чему меня научили два с половиной года ежедневной работы

Маркетинговый тех-стек, на котором я реально работаю в 2026 годуAI и маркетинг
Aug 2026

Маркетинговый тех-стек, на котором я реально работаю в 2026 году