Az OpenAI hivatalosan elérhetővé tette a GPT-6 Sol és a GPT-6 Luna nyelvi modelleket, amelyek az előző generációhoz mérten felezett tokenárakkal próbálják felvenni a versenyt a rivális Anthropic megoldásaival – számolt be a bejelentésről a The Decoder szakmai beszámolója. A gyártó elsősorban a hatékonyabb gyorsítótárazással és az optimalizált következtetéssel indokolja a drasztikus árcsökkentést, miközben a korábbi legolcsóbb változat, a Terra teljesen kikerült a kínálatból.

A Sol változat bemeneti ára 2 dollár, kimeneti ára 10 dollár egymillió tokenenként, míg a kisebb feladatokra méretezett Luna esetében a bemenet 0,10 dollárba, a kimenet pedig 0,50 dollárba kerül. A költségcsökkentés mellett a fejlesztők számára új prompt gyorsítótár-műszerfal és diagnosztikai eszköz jelent meg, amellyel a gyorsítótárazott bemeneti tokenekre 90 százalékos kedvezmény érvényesíthető. A gyorsítótár ráadásul úgy maradhat érvényben, hogy a hívások során az érvelési szint vagy az eszközkészlet dinamikusan módosítható.

Benchmarkok és az Anthropic elleni árverseny

A fejlesztői adatok a Claude Opus 5-tel vetik össze az újdonságokat: a számítógépes kezelést vizsgáló OSWorld 2.0 teszten a GPT-6 Sol a rivális szintjét hozza mintegy 80 százalékkal alacsonyabb költségen, bár ezen a téren a korábbi GPT-6 Astra mérések továbbra is a rangsor élén állnak. A 47 üzleti eszközt lefedő AutomationBench felmérésben a Sol maximális érvelési fokozaton jobb eredményt ért el az Opus 5-nél annak feladatonkénti költségének 9 százalékából, míg a Luna 5,4 százalékponttal javított a korábbi szinthez képest 58 százalékos megtakarítás mellett.

A valódi kódkészletbe történő integrációt elemző FrontierCode 1.1 teszten a Sol maximális szinten 49,3 százalékot ért el 2,14 dolláros feladatonkénti költséggel, ami megközelíti a Claude Fable 5.1 50,3 százalékos értékét, utóbbi viszont hatszor többe, 12,83 dollárba kerül feladatonként. A szoftverfejlesztési képességeket mérő DeepSWE v1.1 alatt a Sol 68,8 százalékos pontszámot hozott maximális terhelésnél, miközben az xhigh fokozaton 66,6 százalékot ért el 1 dolláros költséggel.

A GPT-6 Luna és rivális modellek eredményei a DeepSWE v1.1 benchmarkon
Forrás: OpenAI / The Decoder

A Luna árelőnye és az Artificial Analysis mérései

A fenti mérési táblázatból jól látszik a belső portfólió furcsa anomáliája: a 66,6 százalékos DeepSWE eredményt a Luna maximális fokozaton mindössze 0,22 dollárból produkálja, ami 78 százalékos megtakarítás a Solhoz képest alig 2,2 százalékpontos pontszámkülönbség mellett. A fejlesztők számára ez nehezen indokolhatóvá teszi a drágább változat használatát a mindennapi munkafolyamatokban.

Az Artificial Analysis független kiértékelése eközben rámutatott a kompromisszumokra: a feladatonkénti költségek felezése mellett a tiszta intelligenciapontszámok a GPT-5.6 szintjén rekedtek. A kódoló AI-ágensek indexén a Sol 2 ponttal javult, a Luna viszont 2 pontot vesztett. A 44 szakterületet lefedő GDPval-AA v2.1 benchmarkon ráadásul mindkét modell pontszáma csökkent (a Sol mintegy 100 Elo pontot, a Luna 75 Elo pontot veszített), amit a vizsgálat a strukturálatlanabb válaszokkal és a hiányos levezetésekkel magyaráz. Mindeközben az autonóm ágensek felügyeleti mechanizmusai és a fizikai robotikai kockázatelemzés egyre inkább a kiszámítható kimenetet, semmint az agresszív árazást tekintik kritikusnak.

A költségcsökkentés hátterében a következtetési algoritmusok hardverszintű optimalizációja és a hívások gyorsítótár-architektúrájának átalakítása áll.