Az OpenAI szeptember 3-án kiadta a GPT-6 Astrát, két nappal az Anthropic szeptember 1-jei Claude Fable 5.1 kiadása után. A listaár a két modellnél azonos: millió tokenenként 10 dollár a bemenet és 50 dollár a kimenet. A cache-olvasásnál a Fable 5.1 0,25 dollárt kér, az Astra 1 dollárt, vagyis a Fable 5.1 cache-olvasása negyedannyi. A benchmarkokon nincs egyetértés: az OpenAI saját táblájában az Astra vezet a Terminal-Bench 4.0-n (57,9% az 55,8% ellenében), az Artificial Analysis Intelligence Indexén a Fable 5.1 áll elöl (66 pont az Astra 61 pontja előtt). Egyik modell sem vezet minden területen; a döntés a terhelési profilodon és a saját eval-készleteden dől el.
Mi új az Astrában a GPT-5.6 Solhoz képest?
Az OpenAI bejelentéséből ez a cikk öt területet vesz át: computer use (böngésző és asztali alkalmazások kezelése), szakmai munka, agentic kódolás, matematika és tudomány, valamint a hatókör betartása. A legtöbb számhoz megadja az előd GPT-5.6 Sol értékét; a Fable 5.1 értéke ott szerepel, ahol az OpenAI táblája közli.
Computer use-ban az OpenAI az OSWorld 2.0-n a feladatidőt is szimulálta. Az Astra 72,6%-ot ér el feladatonként kb. 40 perc alatt, a Sol 65,7%-ot kb. 75 perc alatt; az OpenAI szerint ez feladatonként kb. 47%-kal kevesebb idő. A frissített Codex harness és az Astra együtt a Mind2Web feladatait 1,9-szer gyorsabban zárja le, mint a mostani Sol-alapú Codex. Ez két külön mérés: az első a modellt önmagában, a második a modellt és a harnesst együtt méri. A Fable 5.1-hez az OSWorld-sorban az OpenAI nem közöl értéket, és a lábjegyzet szerint a Claude-modelleket a hivatalos beállításokkal futtatta. Az Anthropic saját beállításaival mért 77,9%-os részleges Fable 5.1-eredmény így más beállítással készült, mint az Astra 72,6%-a; a két szám ezért nem vethető össze.
Szakmai munkában az üzleti munkafolyamatokat mérő AutomationBenchen 41,4% az Astra, 18,1% a Sol és 31,4% a Fable 5.1. A BenchCAD-en 95,9% az Astra és 84,3% a Fable 5.1; a Claude-számok itt az OpenAI szerint a Fable 5.1 System Cardban leírt három módosítással készültek.
Agentic kódolásban a Terminal-Bench 4.0-n 57,9% az Astra, 37,3% a Sol és 55,8% a Fable 5.1. A DeepSWE v1.1-en 74,1% az Astra és 67,4% a Fable 5.1, a FrontierCode 1.1 Extendeden 64,5%, illetve 63,6%. A Codexben az Astra kísérleti funkcióként jegyzeteket tart a kontextusablakok között, a tisztázó kérdéseit pedig aszinkron teszi fel, miközben folytatja a választól független munkát.
Matematikában és tudományban a FrontierMath Tier 4 (v2) sorában 97,6% az Astra és 87,8% a Fable 5.1 (az OpenAI szövege 98%-ra kerekít). A Terminal-Bench Science 0.1-en 64,6% az Astra és 52,6% a Fable 5.1. Az Astra segített a prímek közötti távolság korlátját 240-ről 186-ra javítani. Az eszközhasználattal mért Humanity's Last Examen a sorrend fordított: 65,0% a Fable 5.1 és 57,2% az Astra.
A hatókör betartását mérő tesztben a Sol az éles védőkorlátok nélkül az esetek 48%-ában lépett túl az engedélyezett célon, az Astra 0%-ában.
Melyik modell vezet a benchmarkokon, és kinek a táblájában?
Ugyanarra a sorra a két fejlesztő két számot ad. Az Anthropic bejelentése az AutomationBenchen a Solt 19,6%-ra teszi, az OpenAI táblája 18,1%-ra; a Fable 5-öt az Anthropic 17,1%-ra, az OpenAI 17,4%-ra. A Terminal-Bench 4.0 Fable 5.1 értékében (55,8%) a két cég egyetért.
Az ábra adatai táblázatban
| Benchmark | GPT-6 Astra | Claude Fable 5.1 | GPT-5.6 Sol |
|---|---|---|---|
| AutomationBench | 41,4% | 31,4% | 18,1% |
| Terminal-Bench 4.0 | 57,9% | 55,8% | 37,3% |
| Terminal-Bench Science 0.1 | 64,6% | 52,6% | 22,4% |
| DeepSWE v1.1 | 74,1% | 67,4% | 72,7% |
| BenchCAD | 95,9% | 84,3% | 83,3% |
| FrontierMath Tier 4 (v2) | 97,6% | 87,8% | 83,0% |
| GPQA Diamond | 96,0% | 93,7% | 94,6% |
| Humanity's Last Exam (w/ tools) | 57,2% | 65,0% | Nem közölt adat |
Az ábra Sol-értékei az OpenAI táblájából: DeepSWE 72,7%, BenchCAD 83,3%, Terminal-Bench Science 22,4%, FrontierMath Tier 4 83,0%; a GPQA Diamondon 96,0% az Astra, 93,7% a Fable 5.1 és 94,6% a Sol.
Az Artificial Analysis összevetése a harmadik forrás: az Intelligence Indexen a Fable 5.1 (max effort) 66 pont, az Astra (max) 61 pont, és a Fable 5.1-et olcsóbbnak is méri: súlyozott átlagára 7,17 dollár millió tokenenként, az Astráé 7,70 dollár, 7:2:1 cache-olvasás/bemenet/kimenet aránnyal számolva. Az OpenAI saját táblája ugyanezt az indexet v4.1.1 verzióban 61,2 és 65,7 ponttal hozza, tehát ez a sorrend az OpenAI tábláján is szerepel. Olvasd el a benchmark-tábla lábjegyzeteit is, és futtasd le a két modellt a saját feladataidon.
Mennyibe kerül a két modell az API-n?
A listaár a két modellnél azonos: millió tokenenként 10 dollár a bemenet és 50 dollár a kimenet, batch-feldolgozásban 5, illetve 25 dollár. Az első különbség a cache-olvasás: az Astra modelloldala szerint 1 dollár, a Fable 5.1 dokumentációja szerint 0,25 dollár, vagyis az Astránál az alapár tizede, a Fable 5.1-nél a negyvenede. A cache-írás (cache write) az Astránál 12,50 dollár, a Fable 5.1-nél 12,50 dollár 5 perces és 20 dollár 1 órás cache-nél. Egy hosszan futó agentic munkamenet minden lépésben újraolvassa a cache-elt előzményt, ezért a különbséget a cache-olvasás ára adja.
Az ábra adatai táblázatban
| USD / millió token | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Bemenet | 10 USD | 4 USD | 10 USD |
| Cache-olvasás | 1 USD | 0,40 USD | 0,25 USD |
| Kimenet | 50 USD | 20 USD | 50 USD |
A Sol cache-olvasása 0,40 dollár millió tokenenként.
A második különbség a hosszú kontextus. Az Astra modelloldala 272 ezer bemeneti token felett a teljes kérésre kétszeres bemeneti és cache-árat, valamint 1,5-szörös kimeneti árat ír; az OpenAI árlistájának hosszú kontextusú oszlopában ez 20, 2, 25 és 75 dollár. A Fable 5.1 a teljes 1 millió tokenes kontextusablakon standard áron számláz. A Fast mode az Astránál legfeljebb kétszeres sebességet ígér kétszeres áron (20 és 100 dollár), EU-n belüli adattárolással (EU data residency) viszont nem érhető el. A regionális feldolgozás az OpenAI-nál 10% felárral jár a 2026. március 5-én vagy azután kiadott modelleknél.
Az OpenAI feladatonkénti költségbecslést is ad: a Terminal-Bench 4.0-n kb. 63%-kal, a Terminal-Bench Science-en kb. 31%-kal, a BenchCAD-en kb. 86%-kal olcsóbb az Astra a Fable 5.1-nél. Ezek az OpenAI becslései; az Artificial Analysis súlyozott átlagára a másik irányba mutat. Az egyik szám tokenárat, a másik tokenfogyasztást mér. A GPT-5.6 Sol az árlistán 4 dollár bemenet és 20 dollár kimenet, promóciós áron legalább 2026. november 21-ig; az Astra ennek két és félszerese.
Egy futó rendszernél a két modell párhuzamos mérése, a váltás tesztelése és bevezetése üzemeltetési feladat — ezt havidíjas konstrukcióban is visszük. AI-rendszerek üzemeltetése
Ki fér hozzá, és hogyan kezeli az adatot a két modell?
A bejelentés szerint az Astrát az OpenAI az első napon egy szűk szervezeti körnek teszi elérhetővé, és a következő napokban érkezik a ChatGPT Plus, Pro, Business és Enterprise csomagokhoz, az OpenAI API-hoz, a Microsoft Azure-hoz és az AWS Bedrockhoz. A Help Center cikke pontosít: a Chat felületen az Astra GPT-6 Pro néven a Pro 100 dolláros, a Pro 200 dolláros, a Business és az Enterprise csomagban jelenik meg, a Plus csomag a Chatben nem tartalmazza. A használati keret: Pro 200 dollárnál heti 200 üzenet, Pro 100 dollárnál heti 50, Business Standardnál havi 15 üzenet, Business Premiumnál heti 50 üzenet, az utóbbi három a GPT-5.6 Sol Próval közös keretből. Enterprise munkaterületen a hozzáférés alapértelmezésben kikapcsolt, az adminisztrátor engedélyezi.
A zéró adatmegőrzésnél (ZDR) a két modell fordított helyzetben van: az Astra a jogosult API-ügyfeleknek megadja, a Fable 5.1 külön engedélyhez köti. A Fable 5.1 30 napos adatmegőrzéssel érhető el, a platformok a Claude API, az Amazon Bedrock, a Google Cloud és a Microsoft Foundry, a szövegkimenet pedig minden platformon az Anthropic statisztikai vízjelét hordozza.
Az üzemeltetési különbség a felügyeletben van. A System Card alapján az OpenAI az Astrát a Preparedness Framework, a cég saját biztonsági keretrendszere szerint a Critical, vagyis kritikus kiberbiztonsági szintre sorolta. A biztonsági áttekintés szerint ez az első OpenAI-modell ezen a szinten, és az Astra minden külső, eszközt hívó kérésén misalignment-monitor működik. Az OpenAI bejelentése ehhez azt írja, hogy ha ez az ellenőrzés megállít egy feladatot, ChatGPT-ben és Codexben a felhasználó átnézheti a lépést, az API-ban a feladat leáll. Ezt a leállást a hívó kódnak kezelnie kell: ha egy hosszan futó agentic munkamenet a lépések közepén megáll, a rendszered dolga az újraindítás, a részeredmény mentése és az emberi eszkaláció. Az Astra a fejlettebb kiberbiztonsági kéréseket, például proof-of-concept exploit írását, elutasítja; a lazább védőkorlátokat az OpenAI a Daybreak programon keresztül a következő hetekre ígéri. A Gray Swan 1810 válogatott prompt injection támadásból álló tesztjén a védőkorlátos Astra támadási sikeraránya 8,5% volt, a Solé 27,0%. Ugyanez a System Card írja le, hogy az Astra gondolati lánca rövidebb és kevésbé informatív lett, ezért a Solhoz képest nehezebb monitorozni.
Mit kell tesztelni váltás előtt?
Az Astra modellazonosítója gpt-6-astra. A Chat Completions, a Responses és a Batch végpont támogatott; a Realtime, az Assistants, a finomhangolás és az embeddings nem támogatott. A reasoning.effort értéke low, medium, high, xhigh vagy max. A kontextusablak 1 050 000 token, a maximális bemenet 922 000, a maximális kimenet 128 000 token; a betanítás adatai 2026. április 30-ig terjednek. Az Astra képességeit és a GPT-5.6 Solhoz mért teljes táblát külön cikkben írtuk meg.
A Fable 5.1-nél a migráció három API-változást érint: a kényszerített tool-hívás 400-as hibát ad, a korábbi modellek nem olvassák a Fable 5.1 thinking-blokkjait, és a korábbi körök szerkesztése érvényteleníti a thinking-blokkokat. A három kompatibilitási pontot és a cache-számítást a Fable 5.1-ről szóló cikkünk részletezi.
Váltás előtt öt dolgot mérj a saját eval-készleteden:
- Tokenfogyasztás feladatonként. Az OpenAI feladatonkénti költségelőnye saját becslés; azonos listaár mellett csak akkor áll, ha a te feladataidon is kevesebb tokent használ.
- Cache-találati arány. Ha a bemenet nagy része cache-olvasás, a Fable 5.1 0,25 dollárja és az Astra 1 dollárja közti különbség dönt.
- A hosszú kérések aránya. Számold ki, a kérések hány százaléka lép 272 ezer bemeneti token fölé; ezeket a kéréseket az Astra teljes egészében a magasabb áron számlázza.
- Leállások és visszautasítások. Az Astránál a biztonsági ellenőrzés az API-ban leállíthatja a feladatot; mérd, hányszor és hol.
- Kompatibilitás. Fable 5-ről a három API-változás, Solról az árszabály és a Fast mode EU-korlátja.
Melyiket válaszd?
Az Astrát válaszd, ha a rendszered computer use-ra épül és a feladatonkénti idő számít, ha terminálalapú kódoló agentet futtatsz, vagy ha az OpenAI-ökoszisztémában ZDR-t kell adnod az ügyfélnek. A Fable 5.1-et válaszd, ha a terhelés erősen agentic és minden lépésben nagy cache-elt előzményt olvas újra, vagy ha a teljes 1 millió tokenes kontextusablakot egységes áron akarod használni.
Kényszer egyik oldalon sincs. A GPT-5.6 Sol elérhető marad az árlistán, promóciós ára legalább 2026. november 21-ig él. A legtöbb terheléshez az Anthropic dokumentációja a Claude Opus 5-öt ajánlja kiindulásnak. Először a terhelési profilod alapján szűkíts, aztán a saját eval-készleteden mérd le a két jelöltet azonos promptokkal és azonos költségkerettel; a döntés ott dől el.

