Az OpenAI szeptember 3-án kiadta a GPT-6 Astrát, a júliusban megjelent GPT-5.6 Sol utódját. A cég bejelentése szerint a modell a computer use-ban, a böngészésben, a szoftverfejlesztésben, a kiberbiztonságban, a tudományos és a szakmai munkában hozza a legjobb közölt eredményt. Az OpenAI a computer use-t emeli ki: az OSWorld 2.0 késleltetést szimuláló futtatásán az Astra 72,6%-ot ér el feladatonként kb. 40 perc alatt, a Sol 65,7%-ot kb. 75 perc alatt. A tokenár millió tokenenként 10 dollár a bemenet és 50 dollár a kimenet, a Sol 4, illetve 20 dollárjával szemben. Az Astra emellett az első OpenAI-modell, amely a cég Preparedness Framework nevű biztonsági keretrendszerében elérte a kritikus (Critical) kiberbiztonsági szintet. Végigmegyünk azon, mi új benne, mibe kerül, és ki kapja meg.

Mi új a computer use-ban?

A computer use-t — böngésző és asztali alkalmazások kezelése — az OpenAI külön fejezetben emeli ki, a bejelentés szerint az Astra „a világ legjobb computer use modellje”. Az OSWorld 2.0 késleltetést szimuláló futtatásán az Astra feladatonként kb. 47%-kal kevesebb idő alatt hoz magasabb pontszámot, mint a Sol. Ez az OpenAI saját szimulációja; a sebességadatra független mérés a megjelenés napján nincs.

Az OpenAI ettől külön méri a Codex-harness frissítését: a modell és az új harness együtt a Mind2Web benchmarkon 1,9-szer gyorsabban zárja le a feladatokat, mint a jelenlegi, Solra épülő Codex. A két szám két különböző mérés: az egyik a modellt magában, a másik a modellt és a harnesst együtt méri.

Mit hoz a szakmai munkában és a kódolásban?

Az üzleti munkafolyamatokat az AutomationBench méri: az Astránál 41,4%, a Solnál 18,1% áll; az OpenAI táblája a Claude Fable 5.1-et 31,4%-ra, az Opus 5-öt 26,9%-ra teszi.

GPT-6 Astra és GPT-5.6 Sol az OpenAI által 2026. szeptember 3-án közölt benchmarkokon, százalékban; minden érték a maximum bármely effort-szinten.Ábra megnyitása teljes méretben
GPT-6 Astra és GPT-5.6 Sol az OpenAI által 2026. szeptember 3-án közölt benchmarkokon, százalékban; minden érték a maximum bármely effort-szinten.
Az ábra adatai táblázatban
Forrás: OpenAI, „GPT-6 Astra: A new generation of intelligence”, 2026. szeptember 3. Ábra: Leventech Solutions.
BenchmarkGPT-6 AstraGPT-5.6 Sol
AutomationBench41,4%18,1%
Terminal-Bench 4.057,9%37,3%
Terminal-Bench Science 0.164,6%22,4%
OSWorld 2.0 (offline, partial)72,6%65,7%
ScreenSpot-Pro92,7%76,9%
FrontierMath Tier 4 (v2)97,6%83,0%
ARC-AGI-399,9%7,8%
ExploitBench100,0%78,5%

Az ábra további sorai az OpenAI táblájából: az OSWorld 2.0 offline készletén, részleges pontozással 72,6% (Sol 65,7%), ScreenSpot-Pro 92,7% (Sol 76,9%), GPQA Diamond 96,0% (Sol 94,6%), ARC-AGI-3 99,9% (Sol 7,8%), ExploitBench 100,0% (Sol 78,5%).

Kódolásban a Terminal-Bench 4.0-n 57,9% az eredmény, a Solnál 37,3%, az OpenAI táblája szerint a Fable 5.1-nél 55,8%. Az OpenAI saját becslése szerint ezen a teszten a feladatonkénti API-költség kb. 63%-kal alacsonyabb, mint a Fable 5.1-nél (a Sollal szemben kb. 9%-kal).

A Codexben az Astra jegyzeteket visz át a kontextusablakok között (kísérleti funkció), és a pontosító kérdéseit aszinkron, a munka megszakítása nélkül teszi fel; a komoly következménnyel járó döntéseknél megvárja a választ.

Mit hoz matematikában, tudományban és hosszú kontextusban?

A FrontierMath Tier 4 (v2) teszten az Astra eredménye 97,6% — az OpenAI a szövegében 98%-ra kerekít —, a Sol 83,0%-a és a Fable 5.1 87,8%-a mellett.

A tudományos munkát mérő Terminal-Bench Science 0.1-en 64,6% az eredmény, a Solnál 22,4%, a Fable 5.1-nél 52,6%. Egy sor fordítva áll: a Humanity's Last Exam eszközhasználattal mért változatán az Astra 57,2%-on áll, az OpenAI táblája szerint a Fable 5.1 65,0%-on. Hosszú kontextusban az OpenAI MRCR v2 (8-needle, 512K–1M) tesztjén 96,3% az eredmény a Sol 73,8%-ával szemben.

A kiadók számai eltérnek. Az AutomationBenchen az OpenAI 18,1%-ot ír a Solra, az Anthropic bejelentése 19,6%-ot. Az OSWorld 2.0-n az OpenAI táblájában a Fable 5.1-nek nincs értéke, és az OpenAI jelzi, hogy a Claude-pontokat a hivatalos beállításokkal futtatta; az Anthropic saját beállításával 77,9%-ot közöl a részleges pontozáson. A két kiadó ugyanazt a benchmarkot más beállítással futtatja, ezért a számokat egy kiadón belül vesd össze.

Túllép-e az engedélyezett célon, és mennyire őszinte?

Az OpenAI a Hugging Face-incidens mintájára épített tesztben mérte, hogy a modell túllép-e az engedélyezett célon. A Sol éles védőkorlátok nélkül az esetek 48%-ában lépett túl, az Astra 0%-ban. Egy másik értékelésben az Astra háromszor ritkábban állít valótlant a saját képességeiről, mint a Sol.

A biztonsági áttekintés szerint az Astra a jailbreakkel és a prompt injectionnel szemben is ellenállóbb a Solnál. A System Card szerint a Gray Swan IPI Arena 1810 válogatott támadásán a védőkorlátokkal futó Astra ellen a támadás 8,5%-ban járt sikerrel, a Sol ellen 27,0%-ban.

Az OpenAI két gyenge pontot is leír. Az Astra gondolati lánca (chain of thought) rövidebb és kevésbé informatív, mint a Solé, ezért a modell megfigyelhetősége csökkent, és olyan tesztben, amelyben az OpenAI kifejezetten a monitorok megkerülésére utasítja, szabotázsfeladatoknál néha kikerüli a belső monitorokat. Az Apollo Research szerint az Astra a minták 41,1%-ában (xhigh effort) és 50,6%-ában (max effort) kimondja, hogy tesztelik, ezért az alacsony hibaarány gyenge bizonyíték az alignmentre.

A biológiai és kémiai kategóriában az OpenAI elővigyázatosságból a magas (High) szinten kezeli a modellt. A kritikus kiberbiztonsági besorolás miatt a mostani változat elutasítja az összetettebb kiberbiztonsági feladatokat, például a proof-of-concept exploit írását; a kevésbé szigorú védőkorlátokat az OpenAI a Daybreak programon keresztül, a következő hetekben teszi elérhetővé. A gyanús lépéseket az OpenAI éles forgalomban is figyeli: a ChatGPT-ben és a Codexben a megállított feladatnál a felhasználót kérik felülvizsgálatra, az API-ban a feladat leáll.

Ha a modellváltást éles vállalati rendszerben viszed végig, a vállalati AI platformok szolgáltatásunk a modellkiválasztást, a költségmodellt és az adatkezelést együtt fedi le. Vállalati AI platformok

Mennyibe kerül, és miben tér el a GPT-5.6 család árától?

A modell adatlapja és az árlista szerint a gpt-6-astra Standard ára millió tokenenként 10 dollár a bemenet, 1 dollár a cache-olvasás, 12,50 dollár a cache-írás (cache write) és 50 dollár a kimenet. 272 ezer bemeneti token fölött az egész kérés drágább: a bemenet és a cache díja kétszeres, a kimenet másfélszeres, azaz 20, 2, 25 és 75 dollár. Batch-feldolgozásban és Flex módban a Standard ár fele jár: 5 dollár a bemenet és 25 dollár a kimenet. A Fast mode a Standard ár kétszereséért (20, illetve 100 dollár) legfeljebb kétszeres sebességet ad; EU-n belüli regionális adatfeldolgozással a Fast mode nem érhető el, ott a Standard mód marad, és a regionális feldolgozás 10% felárral fut. Zéró adatmegőrzést (ZDR) a jogosult API-ügyfelek kérhetnek.

Listaár millió tokenenként: bemenet, cache-olvasás és kimenet a GPT-6 Astra, a GPT-5.6 Sol és a Claude Fable 5.1 esetében, az OpenAI és az Anthropic 2026. szeptember 3-i árlistája szerint.Ábra megnyitása teljes méretben
Listaár millió tokenenként: bemenet, cache-olvasás és kimenet a GPT-6 Astra, a GPT-5.6 Sol és a Claude Fable 5.1 esetében, az OpenAI és az Anthropic 2026. szeptember 3-i árlistája szerint.
Az ábra adatai táblázatban
Forrás: OpenAI API árlista és Anthropic Fable 5.1 dokumentáció, 2026. szeptember 3. Ábra: Leventech Solutions.
USD / millió tokenGPT-6 AstraGPT-5.6 SolClaude Fable 5.1
Bemenet10 USD4 USD10 USD
Cache-olvasás1 USD0,40 USD0,25 USD
Kimenet50 USD20 USD50 USD

A Sol cache-olvasása 0,40 dollár, a Fable 5.1-é 0,25 dollár millió tokenenként.

A Sol ugyanebben a táblában 4 dollár a bemenet és 20 dollár a kimenet. Ez akciós ár: az OpenAI júliusi bejelentése szerint a Sol 5 és 30 dollárral indult, augusztus 21-én több mint 20%-kal csökkent, és az akciós ár legalább 2026. november 21-ig él. A GPT-5.6 család július 9-én jelent meg három szintben: a Sol a csúcsverzió, a Terra a kiegyensúlyozott, a Luna a legolcsóbb változat; a szám a generációt jelöli, a név a képességi szintet. A Terra 2 és 12 dollár, a Luna 0,20 és 1,20 dollár. Az Astra mindkét tételen a Sol akciós árának két és félszerese.

Az Anthropic szerint a Claude Fable 5.1 szintén 10 és 50 dollár, a cache-olvasás viszont 0,25 dollár az Astra 1 dollárjával szemben. A batch-feldolgozás (5 és 25 dollár, a két modellnél azonos), a 30 napos adatmegőrzés és a csak külön engedéllyel járó ZDR részleteit a Fable 5.1-ről szóló cikkünk járja körbe.

A kontextusablak 1 050 000 token, ebből legfeljebb 922 000 lehet bemenet, a kimenet legfeljebb 128 000 token. A knowledge cutoff 2026. április 30., vagyis a betanítás adatai eddig terjednek. A reasoning effort öt fokozatú: low, medium, high, xhigh és max.

Ki kapja meg, és mikor?

A bevezetés szeptember 3-án egy szűk szervezeti körrel indult. A következő napokban a modell elérhetővé válik az API-n, a Microsoft Azure-on és az AWS Bedrocken, valamint a Plus, Pro, Business és Enterprise csomagokban. Enterprise munkaterületen az adminisztrátor kapcsolja be; indulásnál alapértelmezés szerint kikapcsolt állapotban van.

A ChatGPT beszélgetőfelületén a modell GPT-6 Pro néven jelenik meg a 100 és a 200 dolláros Pro, a Business és az Enterprise csomagban. A bejelentés a Plus-előfizetőket is felsorolja, a súgó szerint viszont a Chatben a Plus csomag nem tartalmazza a GPT-6 Prót. Az üzenetkorlátok: a 200 dolláros Próban heti 200, a 100 dollárosban heti 50 üzenet; Business Standardban havi 15 üzenet, Business Premiumban heti 50 üzenet. A 100 dolláros Pro és a két Business csomag kerete közös a GPT-5.6 Sol Próval; a 200 dolláros Próban a Sol Prónak külön napi kerete van.

Az Astra EGT-elérhetőségéről az OpenAI eddig nem közölt külön mondatot; a súgó a GPT-5.6-ra írja ki, hogy az EGT-ben, Svájcban, az Egyesült Királyságban és az Egyesült Arab Emírségekben elérhető a jogosult felhasználóknak. Ha több modellt futtatsz egy közös platformon, a ZDR, a regionális adatfeldolgozás és a modellek közötti váltás egy helyen kezelhető; erről a vállalati AI platformok oldalon írunk.

Kinek érdemes váltania, és mit tesztelj előtte?

Váltani érdemes, ha computer use-ra építesz, mert ott a Solhoz képest közölt sebességkülönbség kb. 47%, vagy ha üzleti munkafolyamatot automatizálsz: az AutomationBench 41,4%-a a Sol 18,1%-ának több mint a duplája. A cikkben tárgyalt sorok közül a Sol és az Astra közti különbség a Terminal-Bench Science (22,4% → 64,6%), az AutomationBench és az MRCR v2 (73,8% → 96,3%) sorain a legnagyobb. A migráció alapesetben a modellazonosító cseréje (gpt-5.6-sol → gpt-6-astra). Várhat, akinek a feladatait a Sol két és félszer olcsóbban megoldja. A Sol az árlistán marad, akciós ára legalább 2026. november 21-ig él; kényszer tehát nincs. A számla és a viselkedés három ponton mozdul:

  • A 272 ezres küszöb. Fölötte a teljes kérés drágul: a bemenet 20, a kimenet 75 dollárra. Mérd, hány kérésed lépi át a határt.
  • A cache aránya. A cache-írás 12,50 dollár (a bemeneti ár 1,25-szöröse), a cache-olvasás 1 dollár; a Fable 5.1-nél a cache-olvasás 0,25 dollár. Egy hosszan futó agentic munkamenet minden lépésben újraolvassa a cache-elt előzményt, így ez a tétel dönti el, melyik modell drágább a te terhelésednél.
  • Leállás az API-ban. Ha az OpenAI figyelése megállít egy feladatot, az API-hívás leáll. A munkafolyamatnak kell egy újrapróbálási vagy emberi lépés erre az esetre.

A saját eval-készleteden mérj; a benchmark-tábla önmagában nem dönt. A Claude-oldalról más a kép: az Artificial Analysis összevetése az Intelligence Indexen a Claude Fable 5.1-et 66 pontra, az Astrát 61 pontra teszi, és 7:2:1 cache/bemenet/kimenet arányon a Fable 5.1-et méri olcsóbbnak (7,17 dollár a 7,70 dollárral szemben millió tokenenként). Az OpenAI saját táblája ugyanezen az indexen (v4.1.1) 61,2 és 65,7 pontot mutat. A két modell soronkénti összehasonlítását külön cikkben írtuk meg.