AI do trylmy
JumpStar to najsilniejszy na świecie silnik AI do trylmy
Już na iPhonie Trylma: JumpStar Graj offline z najsilniejszą AI, rozwiązuj codzienne łamigłówki, korzystaj ze wskazówek i zapisuj powtórki.Początki
Zbudowałem JumpStar dla mojej mamy. Projekt zaczął się 15 maja 2026 roku w Indianie, kiedy pomagałem rodzicom wyprowadzić się z domu, w którym dorastaliśmy. Pakując ich rzeczy, znaleźliśmy naszą starą planszę do trylmy i zaczęliśmy wspominać, jak dobrze bawiliśmy się, grając całą rodziną.
Gdy mój brat i ja wyjechaliśmy na studia, mama próbowała znaleźć aplikacje do trylmy na iPhone’a, żeby dalej grać sama, ale żadna nie była dobra. Biorąc pod uwagę sukcesy AlphaGo i Stockfisha, myślałem, że na pewno istnieje wiele silnych silników AI do trylmy o otwartym kodzie – ale tak nie jest. Mimo swojej popularności i elegancji trylma zaskakująco słabo zainteresowała społeczność AI. Właśnie ta luka skłoniła mnie do zbudowania JumpStar.
Moim celem było zbudowanie pierwszego nadludzkiego silnika AI do trylmy. Silny komputerowy przeciwnik pozwoliłby mamie grać dalej, nawet gdy mnie i brata nie ma w pobliżu. Nadludzki silnik AI może nawet odkryć piękne nowe wzorce i strategie, które nie były dotąd szerzej znane.
Dlatego też projekt stał się publiczny. Silny prywatny silnik jest ciekawy, ale trudno komukolwiek innemu go ocenić lub ulepszyć. Publiczny benchmark AI do trylmy sprawia, że tę pracę można sprawdzić: zawiera zestaw zasad, protokół, zestaw pozycji, silniki bazowe, logi i nazwany model JumpStar, któremu inne systemy mogą rzucić wyzwanie.
Piękno trylmy
Trylma to wyścig po planszy w kształcie sześcioramiennej gwiazdy. Każdy gracz zaczyna z grupą dziesięciu pionków w jednym trójkącie i stara się jako pierwszy przeprowadzić wszystkie do trójkąta naprzeciwko. Grać mogą dwie, trzy, cztery lub sześć osób. Są tylko dwa rodzaje ruchu, krok i skok, i nie ma bicia, co jest jednym z powodów, dla których plansza wydaje się tak żywa: proste zasady ruchu tworzą złożony ruch uliczny, gdy gracze próbują budować łańcuchy skoków i przeszkadzać w tym przeciwnikom.
Wbrew angielskiej nazwie Chinese Checkers („chińskie warcaby”) gra nie pochodzi z Chin i nie jest tak naprawdę odmianą warcabów. Jej źródła zwykle wskazuje się w Stern-Halmie, czyli „gwiaździstej halmie” – niemieckiej adaptacji halmy na planszy w kształcie gwiazdy, wydanej w 1892 roku. Znajoma angielska nazwa pojawiła się później za sprawą amerykańskiego marketingu, a gra stała się od tego czasu popularna na całym świecie.
Jak grać w trylmę
W swojej turze ruszasz jednym ze swoich pionków. Pionek może zrobić krok na sąsiednie puste pole albo przeskoczyć sąsiednie zajęte pole i wylądować na pustym polu za nim. Skoki można łączyć w łańcuchy, więc jeden ruch może przy odpowiednim rozstawieniu przemierzyć dużą część planszy. Przeskoczone pionki zostają na planszy. Nie są bite.
Celem jest przeprowadzenie wszystkich pionków do trójkąta leżącego dokładnie naprzeciw trójkąta startowego. Dobra gra to nie tylko pędzenie do przodu. Trzeba budować przydatne drabinki, unikać blokowania własnych pionków, dobrze wykorzystywać zatłoczony środek i oceniać, kiedy ruch, który teraz wydaje się wolny, stworzy później szybszą trasę.
Szczegóły znajdziesz w pełnych zasadach trylmy. Gdy zechcesz grać lepiej, przejdź do poradnika strategii i taktyki JumpStar.
Dlaczego AI do trylmy jest ciekawa
Klasyczne gry planszowe od dziesięcioleci zajmują centralne miejsce w badaniach nad AI. Deep Blue firmy IBM pokonał mistrza świata w szachach Garriego Kasparowa w 1997 roku. AlphaGo pokonał Lee Sedola w 2016 roku. Te gry stały się kamieniami milowymi, bo silna gra komputerów zmieniła sposób, w jaki ludzie je rozumieją.
Trylma nie doczekała się takiego publicznego ekosystemu AI. W porównaniu z szachami i go jest znacznie mniej silników, benchmarków, list rankingowych, publicznych zapisów partii czy wspólnych narzędzi badawczych. Ta luka zaskakuje, bo gra ma dokładnie taką strukturę, jaką lubią badać systemy AI: pełną informację, brak losowości, jasny warunek wygranej i ogromną liczbę możliwych dalszych przebiegów.
Nawet spokojna pozycja wyjściowa szybko się rozgałęzia. W dwuosobowym zestawie zasad JumpStar plansza startowa daje 14 dozwolonych pierwszych ruchów. Po jednym ruchu każdej strony istnieje 196 możliwych sekwencji dwóch posunięć. Na głębokości trzech posunięć z pozycji wyjściowej jest już 4760 możliwych sekwencji ruchów. W dalszej części partii łańcuchy skoków i zatłoczone korytarze sprawiają, że wybory są znacznie mniej oczywiste, niż sugerują zasady.
Czym jest JumpStar
JumpStar to silnik do trylmy trenowany przez grę samego ze sobą, zbudowany na kompaktowym rdzeniu zasad i przeszukiwania w C++20, neuronowym modelu polityki i wartości oraz przeszukiwaniu drzewa Monte Carlo. Jego najsilniejszy publiczny checkpoint, JumpStar_60, jest obecnym mistrzem benchmarku CCERL-2P10-v2. Zaskakująca jest wydajność. Wszystkie modele JumpStar wytrenowano na MacBooku M4, a nie na wielkich klastrach TPU/GPU kojarzonych z przełomowymi systemami do go i szachów.
Ambicją jest gra na nadludzkim poziomie, ale publiczne twierdzenie jest celowo sprawdzalne: JumpStar wydaje się grać na poziomie nadludzkim lub niemal nadludzkim w profilu zasad dla dwóch graczy, a CCERL istnieje po to, by przyszłe silniki mogły zakwestionować ten wynik.
System
JumpStar to nie tylko checkpoint modelu. To kompletny stos silnika i benchmarku: reprezentacja planszy, zasady, przeszukiwanie, gra samego ze sobą, zapisy treningowe, narzędzia sędziowskie i publiczne dowody.
- Zasady i przeszukiwanie. JumpStar korzysta z kompaktowej, bitmapowej reprezentacji 121-polowej gwiaździstej planszy, ścisłych zasad dla dwóch graczy, generowania dozwolonych kroków i ruchów wieloskokowych, blokowania celu, sprawdzania pozycji końcowych, deterministycznego haszowania, botów bazowych i natywnego modułu rozgrywania meczów. Implementacja zasad jest celowo jednoznaczna, bo w przeciwnym razie silniki do trylmy mogą wykorzystywać przypadki brzegowe: okopywać się w trójkątach startowych lub docelowych, tworzyć sztuczne blokady albo wygrywać dzięki osobliwościom sędziego zamiast lepszej gry. Profil zasad JumpStar ma nagradzać czysty wyścig, mocną geometrię i powtarzalne przeszukiwanie, a nie sztuczki z blokowaniem.
- Trening przez grę samego ze sobą. Gra samego ze sobą i ponowna analiza generują stany planszy, dozwolone akcje, liczby odwiedzin MCTS, wyniki partii i cechy postępu. Na tych zapisach trenuje się model polityki i wartości, który kieruje następną rundą przeszukiwania.
JumpStar_60to MLPgeometry_v1o rozmiarze512x4z około10.36Mparametrów, wytrenowany na ponownie przeanalizowanym zbiorze danych liczącym1.8Mprzykładów. Praktyczne wyzwanie polegało na tym, by ta pętla była na tyle mała i szybka, żeby dało się ją wielokrotnie uruchamiać na lokalnym sprzęcie. - Publiczny benchmark. Ponieważ trylma nie miała jeszcze dojrzałego publicznego rankingu silników, równolegle z JumpStar opracowałem
CCERL-2P10-v2. CCERL definiuje zestaw zasad, protokół silników, zamrożony zestaw pozycji, silniki bazowe, artefakty wydań i metodologię rankingu. Benchmark używa sparowanych pozycji z zamianą stron i publikuje logi, dzięki czemu wyniki są powtarzalne, a nie tylko deklarowane. Oznacza to, że przyszłe silniki mogą rzucić wyzwanie JumpStar pod okiem tego samego sędziego, zamiast porównywać mgliste deklaracje o sile gry.
Jak JumpStar gra w trylmę
Jedną z najciekawszych obserwacji jakościowych jest to, że JumpStar często nie gra jak prosta heurystyka wyścigowa. Zamiast tego rozwija wyrafinowane strategie: spowalnia przeciwnika, utrzymuje przydatne pionki blokujące i buduje zwarte, trójkątne formacje, które ograniczają ruch przez ważne korytarze.
Łatwo przeoczyć ten styl, jeśli traktuje się trylmę wyłącznie jako wyścig do przodu. Ponieważ pionki nigdy nie są bite, defensywny układ może mieć znaczenie przez wiele tur: może odciąć drabinkę skoków, zmusić przeciwnika do omijania zatoru albo dać własnym pionkom modelu dość czasu, by dotarły do celu. Niektóre z najmocniejszych pomysłów JumpStar mogą więc dotyczyć kontrolowania geometrii, a nie tylko szybszego posuwania się naprzód.
Zwycięski schemat otwarcia
| # | Gracz | Rodzaj | Ruch |
|---|
Pętla przeszukiwania i treningu
W ogólnym zarysie JumpStar działa według schematu AlphaZero: gra samego ze sobą tworzy cele z liczby odwiedzin MCTS, na tych celach trenuje się model polityki i wartości, a silniejszy model kieruje następną rundą przeszukiwania.
gra samego ze sobą -> cele z odwiedzin MCTS -> trening polityki/wartości -> silniejsze przeszukiwanie -> gra samego ze sobą
Praktyczna siła wzięła się z tego, że ta pętla stała się na tyle tania, by uruchamiać ją wielokrotnie: natywne procesy gry samego ze sobą w C++, wydajne generowanie ruchów, wsadowa ocena liści, transpozycje, ponowne wykorzystanie poddrzew, kompaktowe zapisy i wersje release dostrojone do lokalnego sprzętu Apple.
Duża część tego przyspieszenia wynikała z wykorzystania Codex z GPT-5.5 jako partnera w implementacji i badaniach. Codex pomagał przeglądać kod, profilować wąskie gardła, przepisywać krytyczne ścieżki, analizować logi treningowe, przygotowywać przebiegi benchmarków i prowadzić kilka wątków eksperymentów naraz. Najważniejsze korzyści były praktyczne: duże przyspieszenie gry samego ze sobą i ewaluacji, zmniejszenie zużycia pamięci w ścieżce treningowej o około 98%, dzięki czemu praca zmieściła się na moim lokalnym komputerze, oraz na tyle dużo automatyzacji, by dalej ulepszać silnik, pracując jednocześnie na pełen etat jako CEO Edia.
Projekt posuwał się niezwykle szybko, bo pętla była nie tylko grą modelu samego ze sobą; była też iteracyjną pętlą inżynierską dla całego otaczającego go systemu. Codex pozwalał przeprowadzić eksperyment, zbadać przyczynę porażki, zoptymalizować kod, ponownie uruchomić benchmark, podsumować wynik i zamienić kolejne pytanie w konkretną poprawkę. Ten cykl informacji zwrotnej skompresował pracę, która w innym wypadku mogłaby zająć miesiące – infrastrukturę, narzędzia, frontend, benchmark i opisy – do mniej więcej tygodnia od odnalezienia planszy do publicznej premiery.
Lokalne statystyki Codex dają przybliżone pojęcie o skali tej współpracy. We wszystkich wątkach projektu widocznych w lokalnej bazie stanu Codex zarejestrowane tokens_used wyniosły łącznie około 559.9M tokenów. Liczby te obejmują kontekst, wyniki narzędzi, efekty buforowanego kontekstu, rozliczanie rozumowania i odpowiedzi oraz nakładające się wątki pracy, dlatego należy je traktować jako miarę procesu, a nie naukowy pomiar mocy obliczeniowej.
CCERL i publiczny benchmark
Trylma nie ma dojrzałego publicznego rankingu silników, jaki mają szachy i go, co utrudnia ocenę siły silników i postępów. CCERL wypełnia tę lukę. CCERL to pierwszy publiczny benchmark do oceny siły silników AI do trylmy. Opierając się na podobnych koncepcjach z szachów i go, CCERL zapewnia stałe zasady, zweryfikowane pozycje startowe, sparowane zamiany stron, logi partii do pobrania i publiczne silniki bazowe.
Według benchmarków CCERL JumpStar wydaje się z dużą przewagą najsilniejszym na świecie publicznie dostępnym silnikiem AI do trylmy.
Uważam, że JumpStar osiągnął niemal nadludzką siłę gry w trylmę w profilu zasad dla dwóch graczy, korzystając z lokalnej mocy obliczeniowej na poziomie MacBooka. Co ważniejsze, CCERL daje wszystkim przyszłym współtwórcom cel: zmodyfikuj JumpStar, zbuduj nowy model, wierniej przenieś istniejący silnik, dodaj lepsze pozycje albo zgłoś pretendenta pod okiem tego samego sędziego.
Dalsze plany
JumpStar nie ma być tylko prywatnym botem. Projekt dąży do tego, by stać się czterema rzeczami:
- Silnym publicznym modelem AI. JumpStar jest udostępniony na otwartej licencji, a ta strona jest darmowa. Każdy może zagrać z JumpStar lub samodzielnie spróbować go ulepszyć. JumpStar został wytrenowany w całości na MacBooku M4. Większa moc obliczeniowa z pewnością poprawi jego wyniki.
- Publiczną infrastrukturą benchmarkową. Szachy i go mają społeczności, w których silniki można testować, porównywać i ulepszać. CCERL wnosi tę samą infrastrukturę do trylmy: jasne zasady, powtarzalne mecze, publiczne logi i drogę dla innych do budowania własnych modeli.
- Badaniami nad samą grą. Silna AI zmienia to, co możemy dostrzec. Chcę zrozumieć, jak wygląda dobra gra, jak ewoluują otwarcia, dlaczego zatłoczone plansze zachowują się tak, a nie inaczej, i co dzieje się w grach na trzech, czterech i sześciu graczy, gdy środek planszy zamienia się w korek pełen możliwości.
- Wariantami wieloosobowymi. Model dla dwóch graczy to dopiero początek. Bardziej szalone pytania pojawiają się, gdy na planszy robi się tłoczniej: trzech graczy, czterech, sześciu, zmienne sojusze, zablokowane ścieżki i dziwne, samoistnie powstające otwarcia. Chcę sprawdzić, jak wygląda silna gra także tam oraz na planszach znacznie większych niż standardowe. Złożoność i wzorce, które się wyłonią, będą fascynujące.
Mam nadzieję, że JumpStar zachęci więcej osób, by myślały o trylmie, grały w nią, badały ją i tworzyły wokół niej nowe projekty.