Каждый сентябрь-октябрь одно и то же: крупные лаборатории по очереди выкатывают новые флагманские модели, СМИ пишут “революция”, в комментариях пишут “ничего не изменилось”, а обычный предприниматель листает это всё и не понимает, надо ли ему вообще на это реагировать. Этой осенью волна снова накрыла — вышли новые версии моделей от нескольких крупных игроков почти одновременно, каждая с презентацией, где обещают “качественный скачок”.
Я слежу за этим не ради хайпа, а потому что от того, какая модель реально стала лучше, зависит, что можно предложить клиентам в моих проектах с ИИ-агентами. Поэтому разбираюсь трезво: что в этой волне релизов реально работает по-другому, а что — тот же самый принцип с новой обёрткой и громким названием.
Что обычно обещают в презентациях новых моделей
Стандартный набор заявлений на любом релизе: “думает лучше”, “реже ошибается”, “понимает контекст глубже”, “может работать дольше без вмешательства человека”. Звучит внушительно каждый раз, и каждый раз часть этого правда, а часть — усреднённые цифры на узких тестах, которые в реальной работе почти не проявляются.
Ключевой прогресс последних релизов этой осени — это агентность: модели стали заметно надёжнее в задачах, где нужно совершить не один ответ, а цепочку из десятков шагов подряд — зайти на сайт, найти нужную информацию, сверить с другим источником, принять решение, выполнить действие. Раньше на длинной цепочке модель рано или поздно “теряла мысль” и уходила не туда. Сейчас разрыв между тем, что модель обещает в презентации, и тем, что она реально тянет на практике, заметно сузился именно в этой части.

Где прогресс реальный, а не маркетинг
Реальное улучшение — это способность модели дольше удерживать сложную задачу без потери контекста и без необходимости человеку постоянно всё перепроверять и подталкивать. Для бизнеса это означает: ИИ-агент, который раньше мог квалифицировать простой лид, но путался на сложном многошаговом сценарии (уточнить нужны ли документы, сверить с прайсом, предложить альтернативу, если основной вариант не подходит), теперь тянет это гораздо стабильнее.
Второе реальное улучшение — снижение количества откровенных “галлюцинаций”, то есть уверенно сказанной неправды. Не до нуля, ошибки всё ещё случаются, но по моим собственным наблюдениям на рабочих задачах — заметно реже, чем полгода назад. Для сценариев, где агент общается напрямую с клиентом без модерации человеком, это критично: одна выдуманная деталь про условия услуги может стоить компании доверия клиента.
Третье — цена. Каждая новая волна моделей снижает стоимость обработки того же объёма запросов, потому что более новая и эффективная модель делает то же самое дешевле старой топовой. Это не заголовок для презентации, но именно это реально меняет расклад — то, что полгода назад было дорого для малого бизнеса, сейчас стоит в разы дешевле.

Где хайп сильно обгоняет реальность
А вот что стоит воспринимать со здоровым скепсисом — заявления в духе “модель теперь думает как человек” или “полностью автономный агент, который не нуждается в контроле”. На практике любая система, которая работает без присмотра человека дольше определённого времени, рано или поздно совершает ошибку, которую сама не замечает — просто потому что у неё нет реального понимания последствий, только статистическая догадка о правильном следующем шаге.
Второй хайп — сравнения “модель X обошла человека в тесте Y”. Тесты часто узкоспециализированные и не отражают реальную рабочую нагрузку. Модель может показывать выдающийся результат на бенчмарке и при этом путаться в простом диалоге с раздражённым клиентом, потому что бенчмарк не измеряет то, что измеряет реальная жизнь.
Моё мнение: не гнаться за каждым новым релизом ради самого факта новизны. Смотреть нужно не на маркетинговый текст, а на то, тянет ли конкретная модель конкретный сценарий, который нужен именно тебе — и тестировать это на реальных, а не на выдуманных примерах.

Кстати, у меня в проектах с ИИ-агентами это ощущается напрямую: как только выходит модель с реально лучшей агентностью, я тестирую её на самых капризных сценариях клиентов — там, где раньше агент застревал или путался, — и смотрю, стало ли лучше не в презентации, а в конкретном диалоге.
