OpenAI legújabb matematika felgyorsulása
Az OpenAI 372 új matematikai eredményt közzétett, újraindítva a vitát az AI által generált bizonyítások megbízhatóságáról és jelentőségéről. A kiadás követi a cég korábbi állítását, amely szerint előrelépést ért el a Navier-Stokes létezésének és simaságának problémájában, egy Millennium-díj kihívásban, amely sharp kritikát váltott ki a matematikusok körében, akik kérdőjelezték az automatizált kimenet szigorúságát és ellenőrizhetőségét. A kutatók továbbra is elosztottak abban a kérdésben, hogy az új gyűjtemény valóban előrelépést jelent az automatizált okoskodás terén, vagy csak egy mélyebb szintű mintaillesztés bővítése.
A BigNewsNetwork riportja kiemeli a metodológia körül fellépő szkepticizmust, megjegyezve, hogy az eredmények formális ellenőrzése még nem fejeződött be. A versenyképességi kontextus is változik: a legutóbbi mérlegelések azt jelzik, hogy Alibaba Qwen2.5-ja többszörösen felülmúlja az OpenAI ChatGPT-4-et a matematikai okoskodás feladatai között, ami nyomást gyakorol az OpenAI-ra, hogy ne csak a mennyiség, hanem az ellenőrizhető helyességét is bemutassa legújabb felgyorsulásában.
A pontosan megértéséhez, hogy mit jelent ez az előzetlenül nagy gyűjtemény, a következő fejezet részletezi a 372 benyújtásban rejlő konkrét állításokat.
A 372 eredmény állításai
A testkör több magas profilú problémát céloz meg, beleértve a véges testekben lévő Kakeya-fogalom elméleti megoldását és a Riemann-hipotézis felé vezető haladást új korlátokon keresztül a zéta-függvény nullásai között. További eredmények leírnak mátrixszorzás és gráfikizomorfizmus terén bekövetkező algoritmikus javításokat, területeken, ahol a heurisztikus keresés eddig növekedéses előrelépéseket ért el. A SecurityOnline szerint a kimenetet az Astra modell állította elő, amely specializált modell formalizált bizonyítások szintézisére, természetes nyelvű következtetés helyett.
Minden eredményt Lean 4 kódként adtak be, lehetővé téve a bizonyítássegédnek, hogy mechanikusan ellenőrizze minden logikai lépést elfogadás előtt. Ez a formális ellenőrző folyamat megkülönbözteti a jelenlegi kiadást az előző Navier-Stokes-beadástól, amely gép által ellenőrzött bizonyításokból hiányzott. A Ars Technica megjegyezi, hogy a Lean-tanúsítás átállítja a bizalom terhet a modell átláthatatlanságától a kernel helyességére, bár a matematikusoknak továbbra is ki kell értékelniük, hogy a formalizált állítások pontosan tükrözik-e a szándékolt informal fogalmakat.
Elhelyezve a kiadás technikai tartalmát, most egy tömör összefoglalóval térünk át a legfontosabb tényekre.
Fő tények: OpenAI-matematika felgyorsulás
- 372 matematikai eredmény Lean 4 kódként jelent meg formális ellenőrzéshez
- Célpontok közé tartoznak a véges testekben lévő Kakeya-fogalom, a Riemann-hipotézis korlátai, a mátrixszorzás és a gráfizomorfizmus
- Az Astra modell állította elő, amely specializált formalizált bizonyítások szintézisére lett finomítva, természetes nyelvű következtetés helyett
- Minden eredményt a Lean 4 kernel mechanikusan ellenőrzött el fogadás előtt
- A formális állítások még nem értékelték függetlenül az informal fogalmakkal való egyezésük szempontjából
- A matematika közössége osztott: néhány a ellenőrzés szigorússágát emeli ki, mások pedig kérdőjelezik az újdonságot a skálázott mintaillesztés ellen
Ezen fő pontok figyelembevétele után a cikk tovább vizsgálja, hogyan reagált a kutatóközösség és milyen lehet a jövő.
Közösség reakciója és jövőkép
A matematikusok óvakodó optimizmust és szerkezeti szkepticizmust keverve reagáltak. Andrew Sutherland és Ben Litt hangsúlyozta, hogy a Lean ellenőrzés eltávolítja a logikus hiányokat, de nem garantálja, hogy a formális állítások megfelelnek a szándékolt informal problémáknak, ami eddig az elfogadás fő akadálya maradt. Terence Tao megjegyezte, hogy bár a gép által ellenőrzött eredmények mennyisége unprecedented, a matematika közösség még mindig hiányzik egy közös keretrendszerből, amely lehetővé tenné, hogy értékeljék, ezek a bizonyítások valóban koncepciós előrelépéseket jelölnek-e, vagy csak skálázott mintaillesztésnek minősülő sofistikált mintaillesztés.
Az OpenAI egy olyan tanácsot szervezett össze, amely formalizmusszakértőkből és kutatási matematikusokból áll, hogy kidegyezze a jövő kiadások értékelési protokolljait. A csoport előzetes ajánlásai közé tartoznak a kötelezetlen-től formális állítások auditja, a bizonyítási újdonságra szolgáló nyilvános benchmark-készletek, valamint egy lépcsős kibocsátási folyamat, amely lehetővé teszi a független ellenőrzést a széles körű állítások elött. Ezek a intézkedések célja, hogy orvosolják azt a transzparenciadeficitot, ami eddig korlátozta az előző AI által generált matematika hatását.
A széles körű következmény az, hogy a matematika felfedezésének szervezése változhat: egyéni betekintés, amelyet kollégák ellenőriznek, helyett nagy méretű keresés, amelyet kernel ellenőriz, míg az emberi ítéletképesség problémameghatározás és állítási hűség felé irányul. Ha a tanácsos keretrendszer betöltődik, reprodukálható folyamatot lehet kialakítani, ahol az AI-rendszerek jelölőket proponálnak, és a matematikusok kurátorálják a jelentős részletet, alaposan megváltoztatva a matematikai kutatómunka munkavégzésének felosztását.
Gyakran Ismételt Kérdések
Hogyan generál az Astra modell Lean 4 kódot a formális bizonyítások szintéziséhez, és milyen korlátozások vannak az általános célú modellekhez, például a GPT‑4‑hez képest?
Az Astra modellt egy meglévő Lean 4 bizonyítások corpusa alapján finomították, és megtanulta, hogy hogyan leképezze a matematikai állításokat bizonyítási szkriptekre, nyelvi modellezés és erősítős tanulás kombinációjával a ellenőrzési visszajelzésen. GPT‑4‑hez képest, amely a természetes nyelvű következtetésben kiváló, az Astra a szintaktikai helyességre és bizonyítási taktikákra összpontosít, így nehézségekbe ütközhet olyan új fogalmakkal, amelyekhez nincs tanítási példa. A kimenete a Lean nyelvre korlátozódik, ami a rugalmasságot csökkenti, de biztosítja a bizonyítássegéd programmal való kompatibilitást.
Mit jelent, hogy a 372 eredmény mechanikusan ellenőrzött a Lean 4 kernel által, és ez az ellenőrzés garanciát nyújt a szándékolt informal hipotézisekhez való egyezésre?
A mechanikus ellenőrzés azt jelenti, hogy a Lean 4 kernel ellenőrzi a beküldött kódban lévő minden logikai következtetést, megerősítve, hogy a formális állítások az axiomokból következnek le anélkül, hogy logikus hiányok lennének. Azonban az ellenőrzés csak a belső konzisztenciát garantálja; nem biztosítja, hogy a formálizált tétel pontosan megérintse azt az informal problémát, amely a matematikusok érdeklődésének középpontjában áll. Független átvizsgálásra továbbra is szükség van, hogy megerősítsék, a formális állítások megfelelnek-e az eredeti hipotéziseknek, például a Kakeya-problémának.
Hogyan hasonlít össze az OpenAI matematikai következtetési teljesítménye az Alibaba Qwen2.5‑tel, és mit jelent ez a jövőbeli AI‑alapú bizonyításgeneráláshoz?
Legfrissebb referenciapontok szerint a Qwen2.5 több szabványos matematikai következtetési adatkészleten is túllépi a GPT‑4‑et, így nyomást gyakorol az OpenAI-ra, hogy nemcsak a mennyiséget, hanem az ellenőrzött helyességet is bemutassa. Az OpenAI stratégiája egy specializált modell (Astra) összekötése a Lean ellenőrzéssel, hogy a raw következtetési sebességet ellenőrizhető megbízhatósággal kompenzálja. Ha az ellenőrző folyamat skálázható, új szabványt állíthat be, ahol a sebességre fókuszáló modellek kiegészülnek a formális bizonyítássegéd programokkal, hogy megbízhatóságot biztosítsanak.
Last Updated on október 7, 2026 7:28 du. by Laszlo Szabo / NowadAIs | Published on október 7, 2026 by Laszlo Szabo / NowadAIs


