Кажуть «Епоха AGI» настала, але незалежні тести цього не помітили..
OpenAI вчора випустили GPT‑6 Astra, і президент компанії Грег Брокман закінчив презентацію словами «Ласкаво просимо в епоху AGI». Твіттер палає, блог OpenAI ліг.
Я витратив вечір не на очікування, а на читання незалежних оцінок. Картина там суттєво спокійніша.
Спочатку — що таке AGI
Усі ШІ, які ви знали досі, — вузькі. Кожен блискучий у своїй клітинці: один пише, інший малює, третій кодить. AGI — Artificial General Intelligence, загальний штучний інтелект — це коли клітинок нема. Одна система, яка бере на себе будь-яку розумову роботу людини: розібратися в незнайомій програмі, спланувати проєкт, знайти помилку в договорі, потім — у бухгалтерії. Не тому, що її під це натренували, а тому, що вміє думати й вчитися в принципі.
Це не технічний термін із чітким порогом. Це слово-мрія, яке індустрія обіцяє інвесторам десять років. Тому його так вигідно вимовити першим.
Що показала презентація
98,6% на ARC-AGI-3 — тесті на «загальний» інтелект, де модель має сама розібратися в задачі, якої ніколи не бачила. У Opus 5, кажуть, 30,2%. Плюс математика, автоматизація, CAD — усюди відрив від Fable 5.1.
Звучить як нокаут. Дивимося, що за цим стоїть.
Що показали незалежні оцінки
Один. Artificial Analysis — незалежний агрегатор, який ганяє всі моделі в однакових умовах — дає Astra 61 бал у своєму індексі інтелекту. Claude Fable 5.1 — 66. І головне: 61 — рівно стільки, скільки мав попередник GPT‑5.6 Sol. Покоління змінилося, розум — ні.
Два. Ті самі 98,6% на ARC. На сайті ARC Prize, які цей тест проводять, два результати. У стандартній обгортці, в якій тестують усіх, — 62,7%. У спеціальній «обгортці від провайдера», що дозволяє моделі зберігати приховані міркування між кроками, — 99,95%. OpenAI показали другу цифру, змовчавши про першу. Самі організатори пишуть прямим текстом: «ми не стверджуємо, що це AGI».
Три. Humanity's Last Exam, один із найширших тестів на знання: Fable 5.1 — 65%, Astra — 57%. На презентації не згадали.
Чотири. Кодинг, де сидять найбільші гроші. Незалежний Coding Index: Fable 5 — 68,1, Fable 5.1 — 67,2, Astra — 67,0. Нічия. Це визнає й сама OpenAI: на DeepSWE у них 74,1%, «на рівні лідерів».
П'ять. У таблиці OpenAI для Claude на BenchCAD використали «модифіковані налаштування». Які — не розкрили. Конкурента заміряли не так, як себе.
Тепер про гроші
Ціна API зросла в 2,5 раза: було $4/$20 за мільйон токенів у Sol, стало $10/$50. Токенів Astra витрачає трохи менше, але за підрахунками Artificial Analysis реальна задача коштує приблизно на 75% дорожче. Та сама задача.
Складаємо докупи: інтелект за незалежними тестами не виріс, ціна виросла в 2,5 раза, а презентація відкривається словом «AGI». Це не наукова заява. Це маркетинг.
Чому саме зараз
Цього ж тижня вийшли нові моделі від Anthropic, Meta і Google. Коли на ринку одночасно чотири релізи, виграє не найрозумніша модель, а найгучніший заголовок. «AGI» — найгучніше слово в індустрії. Брокман сказав його «особисто», компанія офіційно — ні: заголовок отримали, відповідальності не взяли.
Гері Маркус, головний скептик сфери, помітив: ранній доступ дали ентузіастам, а критикам — ні. Перші відгуки будуть від відібраних.
Що чесно варто визнати
Не все хайп. Галюцинації впали помітно — це велика справа для реальної роботи. Довгі задачі на тижні Astra тягне значно краще за попередників. І справжня агентність: вона сама сидить за комп'ютером, а не радить.
Хороша модель. Можливо, найкраща в кількох вузьких місцях. Але «найкраща в кількох місцях і дорожча в 2,5 раза» — це не «епоха AGI». За сумою незалежних тестів Claude як був попереду, так і лишився.
Що з цим робити вам
Нічого не змінювати. Якщо у вас працює Claude — він досі об'єктивно сильніший загалом. Якщо цікаво помацати Astra — найближчими днями дають платним підпискам ChatGPT, API за $10/$50. Free і Go — не анонсували.
А слово «AGI» пропоную вимовляти тоді, коли його скажуть незалежні тести, а не президент компанії, яка продає підписку.





