
Генеральный директор OpenAI Сэм Альтман всего несколько недель назад объявил «код красный», призвав к мобилизации всех сил для ускорения разработки новой модели. И вот она — GPT 5.2 официально выпущена, пишет в своей колонке для Forbes Джон Вернер.
«Она лучше справляется с созданием электронных таблиц, подготовкой презентаций, написанием кода, обработкой изображений, пониманием длинных контекстов, использованием инструментов и управлением сложными многоэтапными проектами»
— пояснили в официальном анонсе новой модели.
В анонсе OpenAI также указала, что Notion, Box, Shopify, Harvey и Zoom отметили превосходные результаты GPT 5.2 в «передовых задачах долгосрочного анализа», Databricks, Hex и Triple Whale высоко оценили его эффективность в задачах агентного анализа данных и анализа документов, а Cognition, Warp, Charlie Labs, JetBrains и Augment Code отметили отличные результаты модели в агентном программировании.
Сотрудники OpenAI объясняют, что создали версию 5.2, чтобы помочь в решении «распространенных профессиональных задач» и «раскрыть еще большую экономическую ценность» для пользователей, используя модель, которая может работать над такими задачами, как составление таблиц долей участия и планирование рабочей силы, с тем, что один из рецензентов назвал «более сильной абстракцией, более четким и реалистичным балансом и стратегическими решениями, а также… более глубоким концептуальным пониманием и «атмосферой»», отмечая, что версия 5.2 отлично подходит для задач, требующих высокого уровня аналитических способностей или математического мышления.
Говоря экономическим языком, исследование OpenAI GPT для корпоративного сектора показало, что предыдущие модели экономили профессиональным пользователям от 40 до 60 минут в день, и ожидается, что версия 5.2 превзойдет этот показатель.
Ранее в этом году OpenAI представила концепцию GDPVal, используя идею валового внутреннего продукта для объяснения роли больших языковых моделей в бизнесе.
«Предыдущие методы оценки возможностей ИИ, такие как сложные академические тесты и соревнования по программированию, сыграли важную роль в расширении границ возможностей моделей мышления, но они часто не справлялись с задачами, которые многие люди выполняют в своей повседневной работе, — заявила компания. - Чтобы восполнить этот пробел, мы разрабатываем методы оценки, которые измеряют все более реалистичные и экономически значимые возможности».
Создается впечатление, что это написано специально под ChatGPT 5.2. Это как раз тот тип информации, которую инсайдеры распространяют как подтверждение мощности этой модели. Он также обладает определенной широтой применения: GDPVal охватывает набор из 44 профессий в девяти ведущих отраслях, вносящих наибольший вклад в ВВП США, а также 1320 специализированных задач.
Вот ещё один пример того, как OpenAI говорит о широком применении GDPVal и о его показательности по сравнению с другими бенчмарками: «GDPval отличается как своей реалистичностью, так и разнообразием оцениваемых задач. В отличие от других оценок, связанных с экономической ценностью, которые концентрируются на конкретных областях, GDPval охватывает множество задач и профессий. И в отличие от бенчмарков, которые предполагают синтетическое создание задач в стиле академического экзамена или теста (например, Humanity's Last Exam или MMLU), GDPval фокусируется на задачах, основанных на результатах, которые представляют собой реально существующие работу или продукт».
Еще одно улучшение, о котором говорят пользователи в версии 5.2, связано с классическим машинным обучением, где инженеры размышляли о способности программы «конвергировать» или объединять информацию целенаправленным образом. Существует множество способов осмысления этого процесса: от анализа того, как биологический организм воспринимает визуальные данные, до изучения того, как изменения размерности влияют на результат работы нейронной сети в отношении внимания. Но некоторые из первых пользователей утверждают, что версия 5.2 лучше справляется с конвергенцией, согласованием и целевым выводом, имеющим смысл.