GPT-6 Astra й «епоха AGI», якої не помітили незалежні тести

GPT-6 Astra й «епоха AGI», якої не помітили незалежні тести

Кажуть «Епоха AGI» настала, але незалежні тести цього не помітили..
OpenAI вчора випустили GPT‑6 Astra, і президент компанії Грег Брокман закінчив презентацію словами «Ласкаво просимо в епоху AGI». Твіттер палає, блог OpenAI ліг.
Я витратив вечір не на очікування, а на читання незалежних оцінок. Картина там суттєво спокійніша.

Спочатку — що таке AGI
Усі ШІ, які ви знали досі, — вузькі. Кожен блискучий у своїй клітинці: один пише, інший малює, третій кодить. AGI — Artificial General Intelligence, загальний штучний інтелект — це коли клітинок нема. Одна система, яка бере на себе будь-яку розумову роботу людини: розібратися в незнайомій програмі, спланувати проєкт, знайти помилку в договорі, потім — у бухгалтерії. Не тому, що її під це натренували, а тому, що вміє думати й вчитися в принципі.
Це не технічний термін із чітким порогом. Це слово-мрія, яке індустрія обіцяє інвесторам десять років. Тому його так вигідно вимовити першим.

Що показала презентація
98,6% на ARC-AGI-3 — тесті на «загальний» інтелект, де модель має сама розібратися в задачі, якої ніколи не бачила. У Opus 5, кажуть, 30,2%. Плюс математика, автоматизація, CAD — усюди відрив від Fable 5.1.
Звучить як нокаут. Дивимося, що за цим стоїть.

Що показали незалежні оцінки

Один.
Artificial Analysis — незалежний агрегатор, який ганяє всі моделі в однакових умовах — дає Astra 61 бал у своєму індексі інтелекту. Claude Fable 5.1 — 66. І головне: 61 — рівно стільки, скільки мав попередник GPT‑5.6 Sol. Покоління змінилося, розум — ні.

Два. Ті самі 98,6% на ARC. На сайті ARC Prize, які цей тест проводять, два результати. У стандартній обгортці, в якій тестують усіх, — 62,7%. У спеціальній «обгортці від провайдера», що дозволяє моделі зберігати приховані міркування між кроками, — 99,95%. OpenAI показали другу цифру, змовчавши про першу. Самі організатори пишуть прямим текстом: «ми не стверджуємо, що це AGI».

Три. Humanity's Last Exam, один із найширших тестів на знання: Fable 5.1 — 65%, Astra — 57%. На презентації не згадали.
Чотири. Кодинг, де сидять найбільші гроші. Незалежний Coding Index: Fable 5 — 68,1, Fable 5.1 — 67,2, Astra — 67,0. Нічия. Це визнає й сама OpenAI: на DeepSWE у них 74,1%, «на рівні лідерів».
П'ять. У таблиці OpenAI для Claude на BenchCAD використали «модифіковані налаштування». Які — не розкрили. Конкурента заміряли не так, як себе.

Тепер про гроші
Ціна API зросла в 2,5 раза: було $4/$20 за мільйон токенів у Sol, стало $10/$50. Токенів Astra витрачає трохи менше, але за підрахунками Artificial Analysis реальна задача коштує приблизно на 75% дорожче. Та сама задача.

Складаємо докупи: інтелект за незалежними тестами не виріс, ціна виросла в 2,5 раза, а презентація відкривається словом «AGI». Це не наукова заява. Це маркетинг.

Чому саме зараз
Цього ж тижня вийшли нові моделі від Anthropic, Meta і Google. Коли на ринку одночасно чотири релізи, виграє не найрозумніша модель, а найгучніший заголовок. «AGI» — найгучніше слово в індустрії. Брокман сказав його «особисто», компанія офіційно — ні: заголовок отримали, відповідальності не взяли.
Гері Маркус, головний скептик сфери, помітив: ранній доступ дали ентузіастам, а критикам — ні. Перші відгуки будуть від відібраних.

Що чесно варто визнати
Не все хайп. Галюцинації впали помітно — це велика справа для реальної роботи. Довгі задачі на тижні Astra тягне значно краще за попередників. І справжня агентність: вона сама сидить за комп'ютером, а не радить.
Хороша модель. Можливо, найкраща в кількох вузьких місцях. Але «найкраща в кількох місцях і дорожча в 2,5 раза» — це не «епоха AGI». За сумою незалежних тестів Claude як був попереду, так і лишився.

Що з цим робити вам
Нічого не змінювати. Якщо у вас працює Claude — він досі об'єктивно сильніший загалом. Якщо цікаво помацати Astra — найближчими днями дають платним підпискам ChatGPT, API за $10/$50. Free і Go — не анонсували.

А слово «AGI» пропоную вимовляти тоді, коли його скажуть незалежні тести, а не президент компанії, яка продає підписку.

Gainers | Andrii Shpak

ІнструментиGPT-6 AstraClaude Fable 5.1GPT-5.6 SolOpus 5Fable 5ChatGPTArtificial Analysis
👍 3🤯 1
Обговорити в Telegram
Думки13 червня 2026

Заборона Fable і ефект Стрейзанд: чому ШІ-компанії женуться за увагою

Доступ до Fable 5 і Mythos 5 закрили директивою США. Чому така заборона працює як безкоштовний піар і навіщо компаніям, що втрачають мільярди, наша увага.

Новини та технології24 квітня 2026

GPT-5.5: не оновлення, а зміна поведінки моделі

Що насправді змінилось у GPT-5.5: справляється з довгими завданнями, розуміє намір і сам додає перевірки. Скільки коштує, які мінуси й для яких завдань модель підходить.

Стартує презентація GPT-5: посилання на ефір і чого від неї чекатиНовини та технології
Новини та технології7 серпня 2025

Стартує презентація GPT-5: посилання на ефір і чого від неї чекати

Анонс прямого ефіру з презентацією GPT-5 від OpenAI: де дивитися трансляцію, чому вона корисна навіть без вільної англійської і чого чекали від моделі.

Гумор і курйози16 липня 2026

ChatGPT 3.5 проти Лопати 1.0: чому лопата виграє за кількома пунктами

Жартівливе порівняння ChatGPT зі штиковою лопатою: вона не галюцинує, не має лімітів і не пише «Чудове питання!». А наприкінці серйозно про те, як нам продають ШІ.

Новини та технології9 вересня 2026

ChatGPT навчився перетворювати каракулі на готові зображення

OpenAI додала в ChatGPT функцію Sketch: малюєте ескіз у чаті, описуєте стиль і отримуєте готове зображення. Як запустити її на смартфоні й що нового в Images 2.5.

Новини та технології24 червня 2026

Google віддала $2,7 млрд, щоб повернути Шазіра, а він пішов до OpenAI

Хто такий Ноам Шазір, співавтор статті про Transformer, за що Google віддала $2,7 млрд у 2024-му й чому гроші більше не втримують найцінніших людей у ШІ.

Нові пости спочатку зʼявляються в Telegram

Короткі новини, інструменти й розбори ШІ українською. Без хайпу й води.

Підписатися на t.me/aigainers