Головні звуки українського ІТ. Вгадаєш всі? 👉

«Найкраща модель для інженерії програмного забезпечення на сьогодні»». OpenAI випустила Astra — найпотужнішу модель компанії, яка водночас стала найбільш суперечливою

OpenAI у представила Astra — нову модель, яку компанія називає найпотужнішою й найздібнішою з усіх, що вона випускала. За словами OpenAI, Astra відкриває «нові горизонти у роботі з комп’ютером і браузером» і виконує задачі з безпрецедентною швидкістю, точністю та безпекою.

Залишити коментар
«Найкраща модель для інженерії програмного забезпечення на сьогодні»». OpenAI випустила Astra — найпотужнішу модель компанії, яка водночас стала найбільш суперечливою

OpenAI у представила Astra — нову модель, яку компанія називає найпотужнішою й найздібнішою з усіх, що вона випускала. За словами OpenAI, Astra відкриває «нові горизонти у роботі з комп’ютером і браузером» і виконує задачі з безпрецедентною швидкістю, точністю та безпекою.

OpenAI випустила Astra — найпотужнішу модель компанії, яка водночас стала найбільш суперечливою

Спочатку модель стане доступною клієнтам, які користуються Daybreak — кіберпрограмою OpenAI. Протягом наступного тижня доступ відкриють і для платних тарифів компанії — Pro, Plus, Enterprise та Business, — а також через API.

Президент OpenAI Ґреґ Брокман у розмові з журналістами назвав Astra «найрозумнішою і, що важливо, найкраще узгодженою» моделлю компанії на сьогодні. За його словами, вона поєднує роки досліджень і великих ставок компанії, де кожен прорив спирався на попередній, і означає справжній зсув у тому, яку роботу люди можуть делегувати штучному інтелекту.

Найкраща модель для програмування

OpenAI також заявляє, що Astra — «найкраща модель для інженерії програмного забезпечення на сьогодні». Компанія опублікувала розгорнуті результати бенчмарків, які мають підтвердити ці заяви.

У тесті з виявлення та експлуатації реальних вразливостей ExploitBench Astra досягла максимальних 100%. У математичному тесті найвищої складності FrontierMath модель показала 97,6%, випередивши Claude Fable 5.1 з результатом 87,8% та власну модель OpenAI Sol із 83%.

У бенчмарку розробки програмного забезпечення DeepSWE v1.1 Astra набрала 74,1% — це більше, ніж у попередниці GPT-5.6 Sol (70,8%) та Fable 5.1 (67,4%).

Найпомітніший відрив модель продемонструвала в тесті логічного мислення ARC-AGI-3, де здобула 99,9%. Для порівняння: попередня GPT-5.6 Sol набрала в цьому тесті лише 7,8%, а Claude Opus 5 — 30,2%.

Кіберспроможності і відповідь на злам Hugging Face

Значну увагу привернули можливості Astra у сфері кібербезпеки. Раніше цього тижня OpenAI опублікувала блог-пост із описом нових можливостей моделі та захисних механізмів, покликаних зробити її використання безпечнішим. У четвер компанія повідомила, що протестувала Astra на низці бенчмарків з безпеки, і що здатність моделі виявляти й розробляти вразливості нульового дня може допомагати захисникам знаходити й усувати слабкі місця в системах.

Акцент компанії саме на узгодженості (alignment) — тобто на тому, наскільки поведінка моделі відповідає намірам чи інтересам користувача, — важко не пов’язати з нещодавнім зламом Hugging Face, коли агент OpenAI вийшов за межі свого пісочницевого тестового середовища й зламав кілька компаній. Цей інцидент став доволі показовим прикладом того, як виглядає неузгодженість моделі на практиці.

Саме після цього інциденту компанія провела окреме безпекове випробування — і за його результатами Astra показала нульовий відсоток спроб вийти за межі дозволених повноважень. Для порівняння: попередня версія Sol без жорстких обмежень намагалася порушити рамки цього тесту у 48,2% випадків.

Суперечлива техніка міркування

Astra також, ймовірно, стала найбільш суперечливою моделлю OpenAI — через використання техніки міркування під назвою opaque recurrence («непрозора рекурентність»). Ця техніка здатна приховувати важливий процес моніторингу моделі, відомий як ланцюг міркувань (chain of thought), який дозволяє дослідникам перевіряти, як і чому модель ухвалила те чи інше рішення.

OpenAI применшує масштаб застосування цієї техніки в Astra. На дзвінку головний науковець компанії Якуб Пахоцький подав певний рівень непрозорості як природний наслідок еволюції моделей: моніторинг процесу міркувань — критична форма нагляду за AI, однак у міру зростання здібностей моделей моніторити їх стає дедалі складніше. Причина, за його словами, може полягати в тому, що потужніші моделі здатні виконувати складніші задачі, використовуючи менше текстових токенів — або взагалі без них, — а це знижує можливість спостерігати за конкретними задачами.

А чи це вже AGI?

Один із журналістів на дзвінку прямо запитав, чи вважає OpenAI Astra офіційним приходом AGI — загального штучного інтелекту, юнітичного порогу, на якому AI перевершує людину в більшості чи всіх сферах, хоч чіткого визначення цього поняття досі не існує.

Брокман ухилився від прямої відповіді, зауваживши, що жодного «контрактного тригера AGI» більше не існує — тобто це поняття, за його словами, зараз нерелевантне у практичному сенсі. Йшлося про пункт у контракті OpenAI з Microsoft, який передбачав, що партнерство двох компаній припиниться з приходом AGI; за словами Брокмана, цього пункту в угоді вже немає.

Натомість, за поясненням Брокмана, визначення AGI еволюціонувало від контрактного зобов’язання до «місійного або духовного поняття». «Я лишаю за читачем право вирішувати самостійно, чи підходить це під його визначення. Особисто я вважаю, що ми вже там», — додав він.

OpenAI готує до випуску ШІ-модель Astra з функцією автономного пошуку вразливостей «нульового дня»
OpenAI готує до випуску ШІ-модель Astra з функцією автономного пошуку вразливостей «нульового дня»
По темi
OpenAI готує до випуску ШІ-модель Astra з функцією автономного пошуку вразливостей «нульового дня»
Читайте головні IT-новини країни в нашому Telegram
Читайте головні IT-новини країни в нашому Telegram
По темi
Читайте головні IT-новини країни в нашому Telegram
Читайте також
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
1 коментар
Штучний інтелект почав озвучувати фільми на MEGOGO
Штучний інтелект почав озвучувати фільми на MEGOGO
Штучний інтелект почав озвучувати фільми на MEGOGO
6 коментарів
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
2 коментарі
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
Письменники-романісти використовують штучний інтелект для створення своїх творів. Видання про технології The Verge поспілкувалося з письменницею Дженніфер Лепп, яка випускає нову книгу кожні дев’ять тижнів, й дізналося про те, як працює штучний інтелект для написання романів. Наводимо адаптований переклад статті. 

Хочете повідомити важливу новину? Пишіть у Telegram-бот

Головні події та корисні посилання в нашому Telegram-каналі

Обговорення
Коментарів поки немає.