2026 szeptemberében négy gyártó ad zárt, API-n elérhető modellt vállalati használatra: az OpenAI, az Anthropic, a Google és az xAI. A csúcsmodellek listaára azonos: a GPT-6 Astra és a Claude Fable 5.1 millió tokenenként 10 dollárt kér a bemenetre és 50 dollárt a kimenetre. A középkategória (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.1 Pro, Grok 4.6) 2 dollár bemeneti árral indul. A tényleges költséget három másik tétel dönti el: a cache-olvasás ára, a hosszú kontextus árküszöbe, és az, hogy a modell fut-e abban a felhőben és régióban, ahol az adatod lehet. Ez a cikk a gyártók 2026. szeptember 11-én közölt adatait teszi egymás mellé, és a végén terhelési profil szerint mondja meg, melyik modell az ésszerű választás.
Mit jelent a zárt modell, és miben más, mint a nyílt forráskódú?
Zárt (proprietary) modellnél a gyártó nem adja ki a súlyokat: a modell a gyártó vagy a partnerfelhő infrastruktúráján fut, a céged API-n keresztül küldi a kérést és kapja a választ. Ilyen a GPT-6 Astra, a Claude Fable 5.1, a Gemini 3.1 Pro és a Grok 4.6. Nyílt forráskódú modellnél (Llama 4, Qwen 3.5, Mistral 3) a súlyok letölthetők, a modell a saját szervereden is futtatható, és az adat a hívás idejére sem hagyja el a környezetedet.
A választás két külön cikkünk témája: a nyílt és zárt modellek összehasonlítása a teljes birtoklási költséget számolja, az on-premise vagy felhő alapú AI a futtatás helyét. Ez a cikk a zárt oldalon marad: ha már eldőlt, hogy API-n hívott modellel dolgozol, melyiket válaszd.
Mennyibe kerülnek a zárt modellek az API-n?
A listaár millió tokenenként értendő, külön a bemenetre (a prompt és a kontextus), a cache-olvasásra (a már egyszer beküldött, újrahasznált előzmény) és a kimenetre (a modell válasza). Az alábbi értékek a gyártók árlistáiról származnak, standard feldolgozásra és rövid kontextusra; a batch-feldolgozás az OpenAI-nál és az Anthropicnál a listaár fele.
Az ábra adatai táblázatban
| Modell | Bemenet | Cache-olvasás | Kimenet |
|---|---|---|---|
| GPT-6 Astra | 10 USD | 1 USD | 50 USD |
| GPT-5.6 Sol | 4 USD | 0,40 USD | 20 USD |
| GPT-5.6 Terra | 2 USD | 0,20 USD | 12 USD |
| Claude Fable 5.1 | 10 USD | 0,25 USD | 50 USD |
| Claude Opus 5 | 5 USD | 0,50 USD | 25 USD |
| Claude Sonnet 5 | 2 USD | 0,20 USD | 10 USD |
| Gemini 3.1 Pro | 2 USD | 0,20 USD | 12 USD |
| Gemini 3.8 Flash | 0,75 USD | 0,075 USD | 3,75 USD |
| Grok 4.6 | 2 USD | 0,50 USD | 6 USD |
Az OpenAI árlistája szerint a GPT-6 Astra 10 dollár bemenet, 1 dollár cache-olvasás és 50 dollár kimenet. A GPT-5.6 Sol 4 dollár, 0,40 dollár és 20 dollár, promóciós áron, az OpenAI szerint legalább 2026. november 21-ig. A GPT-5.6 Terra 2 dollár, 0,20 dollár és 12 dollár.
Az Anthropic árlistája szerint a Claude Fable 5.1 10 dollár bemenet, 0,25 dollár cache-olvasás és 50 dollár kimenet. A Claude Opus 5 5 dollár, 0,50 dollár és 25 dollár. A Claude Sonnet 5 2 dollár, 0,20 dollár és 10 dollár; ezt az árat az Anthropic bevezető árként hirdette 2026. augusztus 31-ig, és a tervezett emelés helyett ezt tette meg standard árnak.
A Google Gemini API árlistája szerint a Gemini 3.1 Pro (preview) 2 dollár bemenet, 0,20 dollár cache-olvasás és 12 dollár kimenet 200 000 tokenes promptig. A Gemini 3.8 Flash 0,75 dollár, 0,075 dollár és 3,75 dollár, promóciós áron 2026. december 31-ig; utána 1,50 dollár, 0,15 dollár és 7,50 dollár.
Az xAI modelloldala szerint a Grok 4.6 2 dollár bemenet, 0,50 dollár cache-olvasás és 6 dollár kimenet 200 000 tokenes promptig.
A puszta tokenár két ponton félrevezet. Az Anthropic közlése szerint a Claude 4.7-tel bevezetett tokenizáló ugyanarra a szövegre kb. 30%-kal több tokent ad, mint az előző; azonos szövegre tehát a Claude-modellek több tokent számláznak, mint amit a régi tokenizálóval mértél. Az OpenAI és az Anthropic feladatonkénti költségbecslései pedig eltérő tokenfogyasztást mérnek, ezért két azonos listaárú modell feladatonként más összegbe kerül. A tokenár a kiindulás; a saját feladataidon mért költség a döntés alapja.
Miért a cache-olvasás ára dönt agentic terhelésnél?
Egy agent minden lépésben újraolvassa a rendszerpromptot, az eszközleírásokat és a beszélgetés előzményét. Egy hosszabb munkamenetben a beküldött tokenek nagy része ezért cache-olvasás, és a listaárhoz képest ez a tétel adja a különbséget. A Fable 5.1 cache-olvasása a bemeneti ár 2,5%-a (0,25 dollár a 10 dollárból), az Astránál, a Solnál, a Terránál, az Opus 5-nél, a Sonnet 5-nél és a két Gemini-modellnél 10%, a Grok 4.6-nál 25% (0,50 dollár a 2 dollárból).
Az ábra adatai táblázatban
| Modell | Súlyozott ár (7:2:1) |
|---|---|
| GPT-6 Astra | 7,70 USD |
| Claude Fable 5.1 | 7,17 USD |
| Claude Opus 5 | 3,85 USD |
| GPT-5.6 Sol | 3,08 USD |
| GPT-5.6 Terra | 1,74 USD |
| Gemini 3.1 Pro | 1,74 USD |
| Claude Sonnet 5 | 1,54 USD |
| Grok 4.6 | 1,35 USD |
| Gemini 3.8 Flash | 0,58 USD |
Az ábra az Artificial Analysis súlyozását követi: 70% cache-olvasás, 20% bemenet, 10% kimenet. Ezzel a GPT-6 Astra 7,70 dollár, a Claude Fable 5.1 7,17 dollár, a Claude Opus 5 3,85 dollár, a GPT-5.6 Sol 3,08 dollár, a GPT-5.6 Terra és a Gemini 3.1 Pro 1,74 dollár, a Claude Sonnet 5 1,54 dollár, a Grok 4.6 1,35 dollár, a Gemini 3.8 Flash 0,58 dollár millió tokenenként. A két csúcsmodell között azonos listaár mellett így 7% a különbség, a csúcs és a középkategória között négy-ötszörös.
A cache írása is pénzbe kerül: az Anthropicnál az 5 perces cache írása a bemeneti ár 1,25-szöröse, az 1 órásé a kétszerese. A saját arányod eltér az ábra 7:2:1 súlyozásától; a pilot alatt mérd ki, a beküldött tokenek hány százaléka cache-találat, és azzal számolj.
Mekkora kontextusablakot kapsz, és hol drágul meg?
A kontextusablak a bemenet és a kimenet együttes felső határa egy kérésben. A gyártók 500 000 és 1 050 000 token között adnak ablakot, de a nagy ablakot nem mindenki adja egy áron.
Az ábra adatai táblázatban
| Modell | Kontextusablak | Árküszöb | Ár a küszöb felett |
|---|---|---|---|
| GPT-6 Astra | 1 050 000 token | 272 000 token | 2x bemenet, 1,5x kimenet |
| GPT-5.6 Sol | 1 050 000 token | 272 000 token | 2x bemenet, 1,5x kimenet |
| GPT-5.6 Terra | 1 050 000 token | 272 000 token | 2x bemenet, 1,5x kimenet |
| Claude Fable 5.1 | 1 000 000 token | nincs | standard ár a teljes ablakon |
| Claude Opus 5 | 1 000 000 token | nincs | standard ár a teljes ablakon |
| Claude Sonnet 5 | 1 000 000 token | nincs | standard ár a teljes ablakon |
| Gemini 3.1 Pro | 1 000 000 token | 200 000 token | 2x bemenet, 1,5x kimenet |
| Gemini 3.8 Flash | 1 000 000 token | nincs | standard ár a teljes ablakon |
| Grok 4.6 | 500 000 token | 200 000 token | 2x bemenet, 2x kimenet |
A GPT-6 Astra, a GPT-5.6 Sol és a GPT-5.6 Terra modelloldala 1 050 000 tokenes ablakot és 128 000 tokenes maximális kimenetet ad; 272 000 bemeneti token felett a teljes kérésre kétszeres bemeneti és cache-ár, valamint 1,5-szörös kimeneti ár érvényes. A Claude Fable 5.1, Opus 5 és Sonnet 5 az Anthropic modelláttekintése szerint 1 000 000 tokenes ablakot és 128 000 tokenes kimenetet ad, és a teljes ablakon standard áron számláz; a Claude Haiku 4.5 ablaka 200 000 token. A Gemini 3.1 Pro és a Gemini 3.8 Flash ablaka a Google DeepMind modelloldalai szerint 1 000 000 token, a kimenet 64 000 token; a Pro 200 000 bemeneti token felett 4 dollár bemenetet és 18 dollár kimenetet számláz, a Flashnél az árlista egy árat közöl. A Grok 4.6 ablaka az xAI API-n 500 000 token, 200 000 felett 4 dollár bemenet és 12 dollár kimenet; a Microsoft Foundryban ugyanez a modell a Microsoft dokumentációja szerint 200 000 tokenes ablakkal fut.
A gyakorlatban ez azt jelenti: ha a kéréseid egy része 272 000 token fölé megy (teljes szerződéses dosszié, nagy kódbázis, hosszú napló), az OpenAI-modelleknél ezeket a kéréseket teljes egészében a magasabb áron fizeted; a Claude-modelleknél ugyanezek a kérések standard áron futnak. Számold ki a pilot alatt, a kérések hány százaléka lépi át a küszöböt.
A modellválasztás a terhelési profil, az adatút és a felhőszerződés együttes döntése; a jelöltek kiválasztását és a saját eval-készleten futó összevetést tanácsadási keretben végezzük. AI stratégiai tanácsadás
Hol fut a modell, és hová kerül az adat?
A zárt modell ott fut, ahol a gyártó vagy a partnerfelhő futtatja. Ez két kérdést dönt el egyszerre: melyik felhőszerződésed alatt számlázható, és melyik régióban dolgozza fel az adatot.
Az ábra adatai táblázatban
| Gyártó | Saját API | Microsoft Foundry | Amazon Bedrock | Google Cloud |
|---|---|---|---|---|
| OpenAI (GPT-6 Astra, GPT-5.6) | igen | igen | igen | nem közölt |
| Anthropic (Claude 5) | igen | igen | igen | igen |
| Google (Gemini 3) | igen | nem közölt | nem közölt | igen |
| xAI (Grok 4.6) | igen | igen | nem közölt | nem közölt |
Az OpenAI a GPT-6 Astra bejelentése szerint a saját API-n, a Microsoft Azure-on és az AWS Bedrockon adja a modellt. Az Anthropic a Claude API mellett az Amazon Bedrockon, a Google Cloudon és a Microsoft Foundryban is elérhetővé teszi a Fable 5.1-et, az Opus 5-öt és a Sonnet 5-öt. A Google a Geminit a Gemini API-n és a Google Cloudon (Gemini Enterprise Agent Platform, korábban Vertex AI) adja; a Google Cloud modell-listája a Gemini 3.8 Flash és a 3.1 Pro mellett a három Claude 5-ös modellt, a Llama 4-et és a Mistral modelleket is tartalmazza. Az xAI a Grok 4.6-ot a saját API-n adja, és az xAI közlése szerint 2026. augusztus 26-tól a Microsoft Foundryban is, ott előzetes (preview) állapotban.
Az EU-n belüli adattárolás (EU data residency) gyártónként más. Az OpenAI adatkezelési dokumentációja szerint az európai régió (eu.api.openai.com végpont) regionális tárolást és regionális feldolgozást is ad; a módosított visszaélés-figyeléshez és a zéró adatmegőrzéshez (ZDR) az OpenAI engedélye kell, és a 2026. március 5-én vagy azután kiadott modelleknél a regionális végpont 10% felárral jár, így a szeptember 3-án kiadott Astránál is. Az Astra Fast mode-ja EU-adattárolással nem érhető el. Alapértelmezésben az OpenAI a visszaélés-figyelési naplókat legfeljebb 30 napig őrzi, és az API-n beküldött adaton 2023. március 1. óta csak kifejezett hozzájárulással tanít.
Az Anthropic adatrezidencia-dokumentációja szerint az inference_geo paraméter két értéket ismer: us és global; EU-régiót az Anthropic saját API-ja nem ad, a workspace geo is csak us lehet. EU-régiót a Claude-modellekhez az Amazon Bedrock és a Google Cloud regionális végpontjain kapsz, ezek a globális végponthoz képest 10% felárral számláznak. Az adatmegőrzési szabály szerint az Anthropic a promptot és a választ alapból nem tárolja, kivétel a Fable 5.1, a Mythos 5.1, a Fable 5 és a Mythos 5: ezeknél 30 napos megőrzés kötelező, és ZDR csak az Anthropic külön engedélyével jár; a többi modellnél a ZDR-t szervezetenként az értékesítésen keresztül kell kérni. Tanításra kifejezett engedély nélkül nem használja az adatot.
A Google a Gemini API feltételei szerint a fizetős szolgáltatásban a promptokat és a válaszokat nem használja a termékei fejlesztésére; a free tier szinten igen. A Gemini-modellek EU-régiós elérhetőségét a Google Cloud régiónkénti modelltáblájában modellenként ellenőrizd, mert a Flash-generációk eltérő ütemben kapják meg a regionális végpontokat.
Az xAI-nál a Microsoft dokumentációja a Grok 4.6-ot csak Global Standard telepítésben sorolja fel; a Grok 4.3 és a korábbi Grok-modellek Data Zone Standard (US) telepítésben is elérhetők, EU-adatzónát a táblázat egyik Grok-modellnél sem közöl.
Mi köt a gyártóhoz, és hogyan tartod nyitva a váltást?
A zárt modell a gyártó ütemtervéhez köt. Az Anthropic a modelláttekintésben visszavonási vállalást közöl: a Fable 5.1 legkorábban 2027. szeptember 1-jén, az Opus 5 2027. július 24-én, a Sonnet 5 2027. június 30-án, a Haiku 4.5 2026. október 15-én vonható vissza. Az OpenAI a Sol promóciós árát 2026. november 21-ig, a Google a 3.8 Flash promóciós árát 2026. december 31-ig garantálja; utána más ár érvényes.
A második kötés a platform. Ugyanaz a modell más ablakkal fut más felhőben (a Grok 4.6 500 000 tokennel az xAI API-n, 200 000-rel a Foundryban), a gyorsított mód pedig több gyártónál csak a gyártó saját API-ján érhető el: az Anthropic Fast mode-ja (Opus 5 és Opus 4.8, 10 és 50 dollár) a Claude API-ra korlátozódik, az OpenAI Astra Fast mode-ja EU-adattárolással nem hívható.
A harmadik kötés az API. Az Astra nem támogatja a finomhangolást, az Assistants és a Realtime végpontot; a Fable 5.1 három API-változást hozott a Fable 5-hez képest, ezeket a GPT-6 Astra vagy Claude Fable 5.1 cikkünkben írtuk le.
Így tartod nyitva a váltást:
- Egy modellréteg a saját kódodban. A modellhívás egy helyen történik, a modellazonosító és a paraméterek konfigurációból jönnek. Az általunk épített vállalati AI platformok így készülnek.
- Saját eval-készlet. Ötven-száz valós feladat a saját adatodból, elvárt válasszal. Minden jelölt modell ezen fut le, azonos prompttal és költségkerettel.
- Költség feladatonként. A tokenár mellé a feladatonkénti tokenfogyasztást is mérd; a két csúcsmodell között ez adja a tényleges különbséget.
- Cache-találati arány és a hosszú kérések aránya. Ez a két szám dönti el, hogy a cache-olvasás ára és az árküszöb mennyit számít nálad.
- Adatút szerződésben. Írd le, melyik régióban fut a modell, ki az adatfeldolgozó (a gyártó vagy a felhőszolgáltató), és mennyi a megőrzési idő.
Melyik zárt modellt válaszd?
A gyártók közölt adatai alapján terhelési profil szerint:
- Hosszú, összetett agentic munka, ahol a minőség dönt: GPT-6 Astra vagy Claude Fable 5.1. Azonos listaár mellett a cache-olvasás dönt: súlyozott áron 7,70, illetve 7,17 dollár. A két modell benchmark-összevetését külön cikkben írtuk meg.
- Vegyes vállalati terhelés jó ár-érték arányban: Claude Opus 5 (3,85 dollár súlyozott áron) vagy GPT-5.6 Sol (3,08 dollár, promóciós áron november 21-ig).
- Nagy volumen, alacsony ár: Claude Sonnet 5, GPT-5.6 Terra és Gemini 3.1 Pro 1,54 és 1,74 dollár között; a Gemini 3.8 Flash 0,58 dollár promóciós áron.
- EU-adattárolás a gyártó saját API-ján: OpenAI az eu.api.openai.com végponton, 10% felárral és engedéllyel. Claude-hoz EU-régiót az Amazon Bedrock vagy a Google Cloud ad. A Grok 4.6 a Foundryban jelenleg csak globális telepítésben fut.
- Meglévő felhőszerződés alatt: Azure-on OpenAI, Claude és Grok; AWS-en OpenAI és Claude; Google Cloudon Gemini és Claude.
Egyik gyártó sem a legjobb minden szempontból. Először a terhelési profilod és az adatod útja alapján szűkíts két-három jelöltre, aztán a saját eval-készleteden mérd le őket azonos promptokkal; a döntés ott dől el.

