- Что произошло
- Почему это важно
- Ключевые изменения: что нового в GPT-5.4
- Computer use: ИИ, который реально работает в интерфейсах
- Tool search: когда инструментов много, а контекст не должен взрываться
- Контекст до 1M токенов: длинные задачи без обрезания памяти
- Надёжность и качество: меньше ошибок и более профессиональные результаты
- Цифры релиза: ключевые сравнения
- Почему это большой шаг к агентам
- Разбор ключевых изменений
- Computer use — что умеет на практике
- Tool search — что меняется в архитектуре
- Длинный контекст — реальная польза, без магии
- Что стало лучше по качеству (и где это заметно)
- Нюансы и ограничения
- Кому это особенно полезно (3 профиля)
- 1) Обычный пользователь ChatGPT
- 2) Контент, офис, аналитика
- 3) Разработчики, автоматизация, агентные системы
- Практика: что можно протестировать в GPT-5.4
- Заключение
OpenAI представила GPT-5.4 и GPT-5.4 Pro — новые флагманские модели, заточенные под профессиональные задачи и агентные сценарии. В центре релиза — нативное управление компьютером (computer use), tool search для работы с большим набором инструментов и заметный прирост надёжности в сложных цепочках действий. По сути это обновление выглядит как шаг от просто умных ответов к моделям, которые умеют не только рассуждать, но и стабильно выполнять работу в интерфейсах, использовать инструменты и собирать результат под ключ. Разберём, что именно вышло, где это уже доступно и какие изменения в GPT-5.4 действительно важны.
Что произошло
5 марта 2026 OpenAI выпустила GPT-5.4 и GPT-5.4 Pro и начала раскатку в своих основных продуктах. В ChatGPT модель доступна как GPT-5.4 Thinking, а Pro-версия — для пользователей Pro и Enterprise. В API появились модели gpt-5.4 и gpt-5.4-pro, а в Codex релиз связан с задачами разработки и длинным контекстом. В компании подчёркивают, что фокус обновления — профессиональные сценарии и агентные системы: работа с интерфейсами, инструментами и сложными задачами, где важны точность и устойчивость.
Обновление пришло как замена поколения: GPT-5.4 Thinking в ChatGPT заменяет GPT-5.2 Thinking, а предыдущую версию оставляют в Legacy на ограниченный срок, после чего планируют отключить. Параллельно OpenAI делает акцент на двух направлениях: с одной стороны — улучшение качества и снижение ошибок в ответах, с другой — развитие агентных возможностей (computer use и работа с большим количеством инструментов через tool search), которые помогают модели выполнять действия, а не только описывать, как их выполнить.
Почему это важно
Этот релиз важен не потому, что модель стала умнее ещё на чуть-чуть. В GPT-5.4 OpenAI явно двигает ChatGPT в сторону практического выполнения задач — когда от модели ждут не красивого текста, а результата: заполнить форму, пройти цепочку шагов в интерфейсе, собрать таблицу, подготовить документ или помочь в проекте с десятками интеграций. Именно такие сценарии раньше чаще всего ломались на мелочах: контекст раздувался, инструменты путались, а интерфейсы требовали слишком много ручного контроля.
GPT-5.4 закрывает сразу три болевые точки: computer use делает действия в интерфейсах более родной частью модели, tool search помогает работать с большим набором инструментов без лишних токенов и хаоса, а улучшения в надёжности снижают риск ошибок там, где цена ошибки выше обычного чата. В сумме это выглядит как переход от ассистента, который советует к базе для агентов, которые могут выполнять работу более автономно и предсказуемо — и именно поэтому релиз так быстро разошёлся как хайповая новость.
Ключевые изменения: что нового в GPT-5.4
В этом релизе важно не потеряться в терминах и цифрах: OpenAI фактически усилила GPT-5.4 по трём направлениям, которые сильнее всего влияют на реальную работу — действия в интерфейсах, работа с инструментами и длинные цепочки задач, где модели нужно держать контекст и не ошибаться. Ниже — четыре ключевых изменения, которые и формируют ощущение шага к агентам.
Computer use: ИИ, который реально работает в интерфейсах
Главная вау-часть релиза — то, что OpenAI делает управление компьютером нативной возможностью модели. Если раньше многие сценарии выглядели так: “модель объяснила, что нажать, а дальше пользователь сам”, то теперь фокус смещается на “модель может выполнить шаги сама” — ориентируясь по скриншотам, кликам, вводу текста и состоянию интерфейса. OpenAI прямо описывает GPT-5.4 как первую general-purpose модель, у которой computer use доведён до уровня “state-of-the-art”, то есть это не побочная демонстрация, а один из ключевых смыслов обновления.
Почему это важно? Потому что настоящие агентные задачи почти всегда упираются в интерфейсы: кабинеты сервисов, админки, порталы, формы, документы, настройки. Там, где API нет или оно ограничено, приходится действовать как человек: открыть страницу, найти нужный блок, заполнить поля, нажать кнопку, проверить, что всё сохранилось, перейти дальше. Именно в таких местах прошлые решения часто ломались на мелочах — банально из-за всплывающих окон, смены верстки, неожиданного скролла или неочевидной кнопки. В GPT-5.4 OpenAI пытается сделать этот слой более надёжным: модель не просто видит интерфейс, а лучше понимает, где она находится в процессе и какие действия реально приводят к нужному результату.
Отдельно стоит то, что OpenAI подтверждает прогресс не только словами, но и цифрами. На OSWorld-Verified (бенчмарк, где модель должна ориентироваться в десктопной среде) GPT-5.4 показывает 75.0% успешности против 47.3% у GPT-5.2, и в релизе также приводится ориентир “human performance” 72.4%. Это звучит как переломный момент: в задачах навигации по реальному окружению модель уже не выглядит игрушкой, которая срабатывает через раз — она всё чаще ведёт себя как исполнитель, которого можно подпускать к рутине.
Ещё важнее, что OpenAI показывает полевую проверку в похожем на бизнес-реальность сценарии: в их тестах на десятках тысяч порталов (HOA/налоги на имущество) GPT-5.4 достигала 95% успеха с первой попытки и 100% за три попытки, при этом работала примерно в 3 раза быстрее и использовала около на 70% меньше токенов, чем предыдущие CUA-подходы. Даже если читатель не знает, что такое CUA, смысл простой: модель стала и надёжнее, и экономичнее, а это ключевое сочетание для автоматизации в масштабе.
На практике computer use — это не волшебная кнопка, которая делает всё. Скорее это новый уровень инструмента: модель может выполнять действия, но человеку всё равно важно задавать рамки — что считается успешным результатом, какие действия запрещены, где нужно подтверждение (например, перед оплатой, удалением или отправкой данных). OpenAI в своей документации отдельно подчеркивает, что для агентных сценариев критичны проверки и защита от инструкций на экране (prompt injection): веб-страница может пытаться обмануть агента, поэтому правила должны идти от пользователя и системы, а не от того, что написано на сайте. Этот момент особенно важен, ибо раньше такие проблемы возникали достаточно часто, и последствия могли быть очень плачевными.
Tool search: когда инструментов много, а контекст не должен взрываться
Вторая ключевая часть релиза — tool search, и она не менее важна для агентных систем, чем computer use. Когда у проекта 5–10 функций, всё просто: вы кладёте описания инструментов в запрос, модель выбирает нужное и вызывает его. Но когда инструментов десятки или сотни (интеграции, MCP-серверы, корпоративные функции, базы знаний, CRM, биллинг), классический подход начинает ломаться: определения инструментов раздувают контекст, съедают бюджет токенов и повышают шанс ошибок выбора не того инструмента.
Tool search решает это по-умному: вместо того чтобы каждый раз тащить в промпт все описания, модель получает возможность искать нужный инструмент и подгружать определения по требованию. В результате агент становится масштабируемым: ему можно дать большой набор возможностей, не превращая каждый запрос в дорогого монстра. OpenAI приводит показательный пример: в тесте с MCP Atlas (36 MCP-серверов) переход на tool search позволил снизить расход токенов на 47% при сохранении точности. Это не косметика — это прямая экономия, которая делает агентные сценарии реальнее в продакшене.
Контекст до 1M токенов: длинные задачи без обрезания памяти
Третья фишка — поддержка до 1 миллиона токенов контекста. Важно правильно понимать, что это даёт: не то, что модель помнит всё навсегда, а то, что можно держать перед ней очень длинные проекты — большие кодовые базы, длинные документы, массивы данных, переписки, спецификации, отчёты — и при этом не резать самое важное. Особенно это актуально для разработки и агентных сценариев, где модель должна помнить правила, состояние и историю действий.
Но мы это в статье обязательно подадим честно: “1M” — это прежде всего про определённые режимы/среды (например, вокруг Codex и API-сценариев), а в пользовательском интерфейсе ChatGPT контекст может быть иным. То есть это мощный инструмент, но не универсальное всем по миллиону прямо сейчас.
Надёжность и качество: меньше ошибок и более профессиональные результаты
И наконец — то, что чувствуется даже тем, кому не нужны агенты. OpenAI заявляет, что GPT-5.4 заметно лучше справляется с профессиональными задачами и снижает количество ошибок: в их оценках модель на 33% реже выдаёт ложные утверждения и на 18% реже даёт ответы, содержащие ошибки, по сравнению с GPT-5.2.
В переводе на человеческий: там, где раньше модель могла уверенно соврать в деталях или допустить мелкую ошибку в расчётах/формулировках, теперь шанс такого поведения ниже. А для рабочих задач это критично: в реальной жизни важнее не красиво написаное, а правильно сделанное. Именно поэтому релиз так сильно цепляет: он одновременно усиливает и ум модели, и её способность быть более надёжным исполнителем.
Цифры релиза: ключевые сравнения
Чтобы это не выглядело как просто громкие слова, OpenAI подкрепляет релиз конкретными метриками — и в них хорошо видно, что фокус GPT-5.4 действительно смещён в сторону агентных и профессиональных задач.
- OSWorld-Verified (десктоп-среда): 75.0% успеха у GPT-5.4 против 47.3% у GPT-5.2; в релизе также указан ориентир human performance 72.4%.
- Tool search (кейс MCP Atlas): –47% токенов при сохранении точности — важный показатель для проектов, где инструментов много, а контекст и стоимость запроса критичны.
- Надёжность: GPT-5.4 на 33% реже выдаёт ложные утверждения и на 18% реже даёт ответы, содержащие ошибки, по сравнению с GPT-5.2.
- Computer use в полевых тестах OpenAI: на сценариях с порталами (HOA/налоги на имущество) GPT-5.4 показала 95% успеха с первой попытки и 100% за три попытки, а также выполняла сессии примерно в 3 раза быстрее, используя около на 70% меньше токенов по сравнению с предыдущими CUA-подходами.
- Визуальный ввод: в релизе описана поддержка режима
detail: "original"для входных изображений до 10.24M пикселей (или ограничение по максимальному размеру стороны), что важно для точной работы со скриншотами и интерфейсами. - Длинный контекст: заявлена поддержка до 1M токенов для длинных задач (с оговорками по доступности в разных продуктах), что напрямую связано с длинным горизонтом агентных сценариев.
Если смотреть на эти цифры вместе, они складываются в понятную картину: GPT-5.4 сильнее не только по качеству текста, а по тем параметрам, которые делают модель пригодной для реальной работы — действия, стабильность, инструменты и масштабируемость.
Почему это большой шаг к агентам
Если упростить, агент — это не модель, которая просто отвечает, а система, которая планирует, действует и проверяет результат. То есть она умеет не только подсказать, как сделать задачу, но и реально довести её до конца: открыть нужный сервис, найти правильный раздел, заполнить данные, создать документ, вызвать инструмент, свериться с условиями и вернуться с готовым итогом. Именно поэтому разговоры про агентов так долго были одновременно хайповыми и немного разочаровывающими: красиво звучит, но на практике всё упиралось в надёжность.
Раньше агентные сценарии чаще всего ломались на трёх местах. Первое — интерфейсы: любое неожиданное окно, новый дизайн страницы или не та кнопка превращали автозадачу в ручной квест. Второе — инструменты: чем больше интеграций, тем тяжелее контекст и тем выше шанс, что модель выберет не тот инструмент или будет тратить токены впустую на описания всех возможных функций. Третье — длинные задачи: когда нужно держать в голове состояние процесса, историю шагов и правила, модель начинала терять нить, повторяться или уверенно ошибаться.
GPT-5.4 выглядит как попытка закрыть эти проблемы системно. Computer use отвечает за первый слой — взаимодействие с реальными интерфейсами становится более родным и устойчивым. Tool search закрывает второй — агент может иметь большой набор возможностей, но подгружать их по мере необходимости, не раздувая каждый запрос. А улучшения в контексте и надёжности усиливают третий слой — модель лучше проходит длинные цепочки действий и реже ошибается на фактах и выводах. Именно поэтому релиз воспринимается не как очередная версия чат-бота, а как фундамент под сценарии, где ИИ выступает исполнителем и помогает доводить задачи до результата.
Разбор ключевых изменений
Выше мы обозначили главное и подкрепили его цифрами. Теперь — тот же релиз, но чуть ближе к земле: что именно меняется в реальной работе, какие сценарии становятся проще и почему некоторые вещи (вроде tool search или длинного контекста) важны не только разработчикам, а всем, кто хочет получать от ИИ результат, а не бесконечные подсказки.
Computer use — что умеет на практике
Computer use — это про ситуации, где у сервиса нет удобного API (или доступ к нему закрыт), а работать всё равно нужно. В таких случаях агент действует как человек: ориентируется по экрану, переходит по разделам, вводит данные, нажимает кнопки, проверяет, что действие завершилось правильно, и двигается дальше. В релизе OpenAI подчёркивает, что GPT-5.4 лучше справляется с таким интерфейсным слоем — а это как раз то, что делает автоматизацию применимой в реальной жизни: личные кабинеты, внутренние админки, порталы, формы, отчёты, настройки.
Важная деталь: хорошее computer use — это когда модель не слепо кликает куда попало, а умеет держать процесс в руках. Например:
- понимает, когда нужно пролистать и найти скрытый блок;
- отличает “кнопку действия” от “кнопки закрыть/назад”;
- проверяет, что данные сохранились, а не просто нажал и пошёл дальше;
- не теряется, если интерфейс поменялся или появилось модальное окно.
Именно поэтому OSWorld и похожие тесты здесь важнее, чем классические текстовые бенчмарки: они приближены к тому, как агент ведёт себя в настоящем софте. И для читателя это переводится в простую мысль: GPT-5.4 потенциально лучше подходит для рутины “сделай шаги в интерфейсе и принеси результат”, а не только “объясни шаги текстом”.
Tool search — что меняется в архитектуре
Tool search — штука, которая звучит технично, но смысл у неё очень понятный. Представь агента, у которого есть десятки интеграций: базы знаний, CRM, календарь, платежи, аналитика, корпоративные сервисы, внутренние функции. Раньше почти всегда приходилось таскать описание всех инструментов в каждом запросе или в большой части запросов. Это:
- раздувает контекст и цену,
- мешает модели быстро находить нужное,
- повышает риск ошибок выбора инструмента.
Tool search меняет это поведение: модель может сначала найти нужный инструмент по каталогу, и только потом подгрузить его точное описание и использовать. В результате агент получается более масштабируемым — можно давать больше возможностей без ощущения, что каждый запрос превращается в тяжёлую энциклопедию функций. И цифра –47% токенов в примере OpenAI как раз про это: экономия возникает не потому, что модель пишет короче, а потому что инфраструктурно перестаёт тратить контекст на то, что не нужно прямо сейчас.
Если переводить на язык продукта: tool search — это один из тех апгрейдов, которые делают агентные системы дешевле и стабильнее, а значит — ближе к реальному внедрению.
Длинный контекст — реальная польза, без магии
Длинный контекст до 1M токенов — это не про идеальную память, а про возможность держать перед моделью большой объём материалов в рамках одной задачи: документацию, длинные переписки, множество требований, большой код, отчёты, таблицы, историю действий агента. Для длинного горизонта (когда задача делается в много шагов и важно помнить, что было раньше) это критично: меньше шансов, что модель забудет ограничение, потеряет важный кусок условий или начнёт повторяться.
Но тут мы будем честными: длинный контекст — это инструмент, который нужно использовать правильно. Большие объёмы данных всё равно требуют структуры: разделения на части, явных приоритетов, краткого плана/правил, к которым модель может возвращаться. И ещё один нюанс, который важно держать в голове: “1M” относится к определённым продуктовым режимам/средам, поэтому в пользовательском опыте у разных людей это может выглядеть по-разному.
Что стало лучше по качеству (и где это заметно)
Помимо новых агентных возможностей, GPT-5.4 важна ещё и тем, что стала более надёжной в обычной работе — там, где пользователь ждёт не эффектного ответа, а правильного результата. OpenAI прямо говорит о снижении ошибок: по их оценкам GPT-5.4 на 33% реже выдаёт ложные утверждения и на 18% реже даёт ответы, в которых есть ошибки, по сравнению с GPT-5.2. Это сильный сигнал: модель меньше уверенно фантазирует и лучше держится за факты и логику.
Где это ощущается в первую очередь:
1) Профессиональные задачи и “деливераблы”.
Когда вы просите не просто объяснить, а сделать результат — таблицу, структурированный документ, план проекта, конспект, смету, презентацию — именно мелкие ошибки и неточности раньше чаще всего портили впечатление. В GPT-5.4 OpenAI делает явный упор на такие сценарии: модель должна лучше собирать итоговый артефакт и реже допускать косяки по невнимательности.
2) Код и работа с большими проектами.
Даже небольшая ошибка в коде (не тот импорт, неверная сигнатура, пропущенный edge case) превращает красивый ответ в лишнее время на отладку. GPT-5.4 позиционируется как шаг вперёд именно в таких задачах: где нужно не только написать код, но и удерживать контекст проекта, требования и ограничения. Отсюда логично вытекает связка с длинным контекстом и tool search: качество улучшается не в вакууме, а за счёт того, что модель лучше работает со сложной средой.
3) Длинные цепочки действий.
В агентных сценариях качество — это не только правда/ложь в фактах, но и устойчивость: не потерять шаг, не перепутать цель, не забыть проверку результата, не уйти в повтор. Когда модель реже ошибается и лучше держит ход выполнения, это сразу отражается на практической полезности: меньше “почти получилось”, больше “сделано до конца”.
Если коротко, GPT-5.4 воспринимается как более рабочая модель: меньше шума, меньше случайных неточностей и больше уверенности, что на выходе получится то, что можно реально использовать — особенно в задачах, где результат важнее разговора.
Нюансы и ограничения
Чтобы не превратить релиз в идеальнейшую модель для всего, важно понимать несколько моментов — они не отменяют силу GPT-5.4, но помогают трезво оценить, где модель даст максимальный эффект, а где всё ещё нужен контроль.
1) “Контекст до 1M” — это не одинаково для всех и не везде.
OpenAI действительно заявляет поддержку очень длинного контекста, но доступность и конкретные лимиты зависят от продукта и режима использования. Поэтому в реальном опыте у читателя миллион токенов может ощущаться по-разному: где-то это ключевая фича, а где-то — скорее перспектива и инструмент для определённых сценариев.
2) Computer use не отменяет необходимость контроля.
Даже если модель лучше ориентируется в интерфейсах, агентные действия всё равно требуют рамок: что считать успехом, какие шаги запрещены, где нужно подтверждение (особенно если речь про отправку данных, удаление, оплату или любые необратимые действия). OpenAI отдельно подчёркивает, что инструкции на экране нельзя считать доверенными — страницы могут пытаться навязать агенту действия через prompt injection, поэтому приоритет всегда за правилами пользователя и системы.
3) Tool search — это преимущественно история про API и интеграции.
Для обычного пользователя важен итог (модель лучше справляется с инструментами), но сам механизм tool search проявляется сильнее всего там, где у проекта действительно много функций/интеграций и есть смысл оптимизировать контекст и стоимость запросов. Если инструментов немного, разница может быть не так заметна.
4) Любые бенчмарки — не гарантия “100% успеха” в вашей задаче.
Цифры в релизе хорошо показывают направление и прогресс, но в реальном мире интерфейсы меняются, данные бывают грязными, а задачи — нестандартными. Поэтому лучший подход — тестировать GPT-5.4 на своих сценариях и постепенно расширять автоматизацию, а не сразу отдавать ей весь процесс “под ключ”.
Кому это особенно полезно (3 профиля)
GPT-5.4 можно воспринимать по-разному в зависимости от того, как вы используете ИИ: как помощника на каждый день, как инструмент для офисных задач и контента или как основу для автоматизации и агентных систем. Ниже — три самых понятных профиля, где обновление раскрывается сильнее всего.
1) Обычный пользователь ChatGPT
Если вы используете ChatGPT для работы, учёбы или бытовых задач, GPT-5.4 в первую очередь ощущается как шаг в сторону более надёжного помощника. Меньше случайных ошибок, лучше удержание логики и более уверенная работа со сложными запросами — всё это важно там, где вы не хотите перепроверять каждую деталь. А если вы периодически делаете задачи “по шагам” (заполнить что-то, найти информацию, собрать документ), направление на computer use и агентные сценарии — это задел на более автоматизированный формат помощи.
2) Контент, офис, аналитика
Для тех, кто регулярно собирает деливераблы — таблицы, планы, отчёты, черновики презентаций и документов — релиз особенно интересен. GPT-5.4 делает ставку на профессиональные задачи и устойчивость: меньше мелких “косяков”, проще длинные цепочки, выше шанс получить результат, который реально можно брать в работу, а не переписывать заново. Плюс, улучшения в визуальном вводе и интерфейсных сценариях потенциально помогают там, где часть данных живёт в скриншотах, админках или личных кабинетах.
3) Разработчики, автоматизация, агентные системы
Это, пожалуй, самый “вкусный” профиль для GPT-5.4. Здесь сходятся все ключевые изменения: computer use как слой взаимодействия с интерфейсами, tool search как способ работать с большим количеством инструментов без раздувания контекста, и длинный контекст для задач, где проект большой, а цепочки действий длинные. В сумме это делает GPT-5.4 более подходящей базой для продуктов, где модель не просто отвечает в чате, а реально выполняет часть процессов и интегрируется в систему.
Практика: что можно протестировать в GPT-5.4
Чтобы быстро почувствовать разницу, лучше не в просто пообщаться, а дать модели задачи, где важны действия, инструменты и устойчивость в длинной цепочке. Вот короткий чеклист, который показывает сильные стороны релиза.
- Задача на интерфейсы: попросите пошагово выполнить сценарий в личном кабинете/админке (найти раздел → заполнить форму → проверить результат). Это самый прямой тест прогресса computer use.
- Длинная задача с горизонтом: дайте большой исходник (бриф/ТЗ/док) и попросите сделать итоговый артефакт: план, структуру, таблицу, черновик презентации — с сохранением требований и ограничений.
- Инструменты (если используете API/интеграции): сравните поведение агента в проекте “много инструментов” — особенно где раньше приходилось тащить огромные описания функций. Здесь лучше всего проявляется tool search.
- Проверка надёжности: возьмите задачу, где модель раньше часто ошибалась (факты, расчёты, сложные условия), и посмотрите, стало ли меньше “уверенных неточностей”.
- Код + контекст проекта: попросите внести изменения в существующий код/структуру проекта и объяснить, где могут быть edge cases и как проверить. Это хороший тест “профессиональной устойчивости”.
Заключение
GPT-5.4 Thinking и GPT-5.4 Pro выглядят как релиз, который меняет акцент: OpenAI всё меньше делает ставку на “чат ради чата” и всё больше — на модели, которые умеют выполнять работу в сложной среде. Computer use приближает ИИ к реальным интерфейсам, tool search делает агентные системы масштабируемыми по инструментам и стоимости, а улучшения в надёжности снижают риск ошибок там, где важен результат, а не красивый текст.
Если эта траектория сохранится, следующий шаг рынка будет очевидным: больше готовых агентных сценариев “под ключ” и больше интеграций, где модель становится частью процесса, а не отдельным окном чата. А для пользователя самый практичный вывод простой: GPT-5.4 стоит тестировать не на разговоре, а на задачах, где важны действия, цепочки шагов и конечный артефакт — именно там обновление раскрывается лучше всего.
