Один з тестерів нових моделей нещодавно сказав в своєму пості, що наступні моделі будуть онтологічним шоком для користувачів. Ну виглядає виконали обіцянку.
Я от казав в 2025, що у нас скоро закінчяться взагалі тести для моделей в яких ми можемо сформулювати і питання і відповідь. І виглядає що ми різко заходимо на цю територію.
Приведу кілька прикладів.
Всього якихось 2-3 роки назад для більшості моделей шкільна математика була непідйомно складною. Вони плутались в таких елементарних речах, що навіть якось невдобно було на це все дивитись.
І Ви могли легко зустріти експертів, які б Вас авторитетно переконали, що це так завжди і буде, бо це ж мовні моделі, стохастичні папуги, і математика це не їх тема.
Ситуація швидко почала змінюватися, коли придумали розмірковуючі моделі. В 2025 на великий подив багатьом моделі вже взяли золото на найбільш престижній і складній міжнародній олімпіаді з математики змагаючись за загальними правилами – той самий ліміт часу, ті самі задачі, в тому ж тексті, без будь яких роз’яснень і перекладів.
Найбільш просунуті експерти в ШІ передбачили цю ситуацію. Тому наприклад Epoch AI в кінці 2024 на початку 2025 представили один з найбільш складних тестів в математиці, Frontier Math.
Вони підійшли до створення цього тесту дуже грунтовно, залучили десятки провідних математиків на конкурсній основі. Сформулювали сотні найбільш складних задач, які розбили на 4 категорії складності, від відносно «простої» університетської математики – категорії 1-3. До найбільш складної передової дослідницького рівня математики – категорія 4. На одну задачу категорії 4 топовий спец в певній сфері своєї спеціалізації міг витратити не один тиждень, щоб задачу сформулювати.
Так от, щоб трішки зрозуміти складність цих задач, і примірятись щодо людського рівня в них, автори тесту провели тест з найбільш талановитими студентами найсильнішого технічного ВУЗу США – МІТ змагання в тестах Frontier math. При чому не індивідуальні, а командні – 8 команд по 4-5 людей, 4.5 години на тест. То от в задачах 1-3 рівня команди набирали 19% в середньому, всі команди разом – 35%. Це у відносно простих задачах 1-3 рівня.
Задачі 4 рівня, які значно складніші, вони навіть не давали в тест. Бо про них навіть професійні математики з провідними медалями (Філдса) казали, що зможуть може вирішити кілька з своєї спеціалізації.
На старті як цей тест представили провідні моделі ШІ вирішували менше 10% навіть простих 1-3 рівня задач.
Так от Астра просто розриває цей тест. Вона вирішує майже все, всю передову сучасну математику зібрану в цьому тесті, 97.6% найскладнішого 4 рівня. Тобто може якусь одну задачу не з’їла з усіх (їх там штук 50 в цьому розділі, складно сформулювати такі). І то, деколи ще помилки є в тестах, ще треба буде дивитись.
Це не те що надлюдський рівень, це надлюдський рівень з пристойним відривом. Ви не знайдете жодного живого математика, який навіть дуже віддалено зможе претендувати на такий результат в цьому тесті.
Тепер мене часто питають, а що ж тут до практики. Гм. Дивне питання.
Ну от візьмемо такий вимір. Коли згадують таємний світовий уряд, рептилоїдів, які правлять світом, першу назву яку називають – як правило це BlackRock. Унікальний фінансовий конгломерат, який керує активами на більш як на 15.3 трильйонів доларів.
Але сам Blackrock, це не тільки і може і не стільки рептилоїди, скільки програмний комплекс Аладін. І цей програмний комплекс використовує навіть не тільки Блекрок (хоча вони його розробили), а і інші організації, і загалом оцінюють, що з цим Аладіном керують активами на більш як 21 трильйонів доларів.
І тут варто задуматись про те, що в світ стрімко приходять моделі ШІ, які демонструють вищий рівень в математиці, ніж будь-хто і очевидно ніж навіть команди таких компаній як Блекрок. Відповідно з цими модельками потенційно можна розробити кращі алгоритми, аналітику, прогнози і тд. Не те щоб я сильно переживав за рептилоїдів, думаю вони отримають доступ до всіх моделей, які їм будуть потрібні. Але цікавий напрямок для роздумів і розробок зовсім нового рівня, хіба ні?
І це тільки один з вимірів нереальних можливостей цієї нової моделі.
Стрибок здібностей просто шалений. Це мабуть найбільш вражаючий реліз за цей рік.
Приведу інший приклад – в дуже складному тесті на творче вирішення нових задач – ARC AGI 3 – дуже хитрий тест. Так от попередня-поточна найкраща модель ОпенАІ GPT 5.6. Sol – яку багато хто в принципі вважав найкращою до вчора. Набирала в Arc AGI 3 жалюгідні 7.8%.
Скільки Астра? Просто розірвала цей тест з результатом 99.9% (з їх responses API).
При чому тут якраз фішка в тому, що в 3 версії тесту, автори спеціально штрафували моделі, які ті намагались пройти тест грубою силою – перебором більшої кількості варіантів. Якщо моделі потрібно було більше кроків, ніж в середньому людям на проходження тесту (це візуальні головоломки), моделі дуже швидко втрачали бали.
То от Астра навпаки в більшості дуже швидко розбиралась в логіці нових ігор (правила не відомі, в цьому якраз складність), з меншою кількістю кроків ніж в середньому люди.
Взагалі додам також лінк на коментар автору Arc AGI 3 - François Chollet. Вони проаналізували міркування моделі для розв'язку задач тестів і їх дуже здивував рівень символічних міркувань щодо задач тесту. Астра зайшла настільки далеко, що створила спеціальну мову для алгебраїчних нотацій станів гри, щоб їй було зручніше головоломки вирішувати.
ARC AGI 3 до речі вийшов тільки в кінці березня 2026 і на час виходу жодна модель не набирала в ньому навіть 10% - настільки спеціально складним для моделей його зробили. Протримався всього кілька місяців. А перший ARC AGI тримався 5 років.
І прикол в тому, що таких тестів десятки і майже у всіх рекордні результати. То це тільки перше інтро. Ще напишу про інші результати і покажу демо.
В доступ Астру дадуть впродовж кількох днів всім користувачам, навіть з підписками за 20 доларів. Вчора дали в доступ тільки довіреним партнерам. Так що рептилоїди нас на кілька днів все ж випереджають. Треба буде в наступні дні наздоганяти.
Як Ваші враження від релізу?
https://epoch.ai/gradient-updates/is-ai-already-superhuman-on-frontiermath
https://epoch.ai/frontiermath/tiers-1-4?view=graph&tab=release-date&tier=Tier+4+%28v2%29&fbclid=
