
Стартап Patronus AI, специализирующийся на оценке и проверке надежности искусственного интеллекта, привлек $50 млн в рамках раунда Series B. Лидером раунда выступила венчурная фирма Greenfield Partners. С учетом предыдущих инвестиций общий объем финансирования компании достиг $70 млн, сообщает TechCrunch.
Привлеченные средства Patronus AI планирует направить на создание «цифровых миров», которые будут использоваться для стресс-тестирования ИИ-агентов. В этих «цифровых мирах» ИИ агенты выполняют сложные, многошаговые сценарии, например, имитируют действия пользователя при оформлении заказа, обработке платежа или внесении изменений в код.
Такой подход позволяет выявлять не только ошибки в логике, но и уязвимости, связанные с безопасностью, стабильностью и поведением ИИ-агента при сбоях. Например, агент может корректно отвечать на вопросы в тесте, но в реальной системе случайно нажать не ту кнопку или нарушить права доступа. Именно эти риски и призваны минимизировать симуляции Patronus.
Клиентами Patronus AI уже стали почти каждая передовая лаборатория искусственного интеллекта и множество новых стартапов, строящих продукты на базе ИИ агентов. Это отражает растущую потребность индустрии в надежных методах валидации – чем сложнее становятся агенты, тем выше цена ошибки.
Показателем востребованности служит и динамика бизнеса. Выручка Patronus выросла в 15 раз за год. Такой рост говорит о том, что компании не просто интересуются технологией, а активно встраивают ее в процессы разработки и контроля качества своих ИИ продуктов.
Традиционные методы оценки ИИ моделей часто фокусируются на метриках вроде точности ответов на тестовых наборах данных. Однако они плохо отражают, насколько надежно ИИ-агент справится с реальной задачей, где есть неоднозначность, изменения интерфейса, ошибки системы и другие факторы «живой среды».
Patronus делает ставку именно на проверку способности агентов выполнять сложные многошаговые задачи. Вместо того чтобы оценивать, насколько умный ответ дает ИИ-модель, компания смотрит, сможет ли ИИ-агент последовательно и безопасно пройти весь рабочий сценарий. Такой подход ближе к реальным потребностям бизнеса и позволяет выявлять проблемы на ранних этапах, до внедрения агентов в продуктивную среду.
На текущем этапе Patronus AI фокусируется на двух ключевых направлениях: программная инженерия и финансы.
В рамках первого направления компания занимается тестированием ИИ ассистентов разработчиков, автогенераторов кода, инструментов рефакторинга и отладки. Здесь критически важна точность и отсутствие «токсичных» или небезопасных решений, которые могут попасть в продакшн.
В рамках второго направления Patronus AI проверяет агентов, участвующих в обработке транзакций, анализе документов, расчетах и соблюдении регуляторных требований. В этой сфере цена ошибки особенно высока, поэтому спрос на надежные методы валидации растет быстрее всего.
В дальнейшем компания намерена расширить подход на более долгие и сложные сценарии работы ИИ-агентов. Речь идет о задачах, где агент должен действовать в течение нескольких часов или дней, координировать работу других инструментов, адаптироваться к изменениям среды и принимать решения в условиях неопределенности. Такие сценарии становятся все более актуальными по мере развития автономных систем.