AI cờ nhảy
JumpStar là engine AI cờ nhảy mạnh nhất thế giới
Đã có trên iPhone Cờ nhảy: JumpStar Đấu với AI mạnh nhất ngay cả khi ngoại tuyến, giải câu đố hằng ngày, nhận gợi ý và lưu lại các ván phát lại.Khởi nguồn
Tôi tạo ra JumpStar cho mẹ tôi. Dự án bắt đầu vào ngày 15 tháng 5 năm 2026 tại Indiana, khi tôi đang giúp bố mẹ chuyển khỏi ngôi nhà nơi chúng tôi lớn lên. Trong lúc thu dọn đồ đạc, chúng tôi tìm thấy bàn cờ nhảy cũ và bắt đầu nhớ lại những lần cả nhà chơi cùng nhau vui đến thế nào.
Sau khi anh trai tôi và tôi đi học đại học, mẹ tôi đã thử tìm các ứng dụng cờ nhảy trên iPhone để có thể tiếp tục chơi một mình, nhưng không ứng dụng nào ra hồn. Với những thành công của AlphaGo và Stockfish, tôi nghĩ chắc chắn phải có nhiều engine AI mã nguồn mở mạnh cho cờ nhảy, nhưng hóa ra là không. Dù phổ biến và tinh tế, cờ nhảy lại nhận được sự quan tâm ít đến bất ngờ từ cộng đồng AI. Chính khoảng trống đó đã thôi thúc tôi xây dựng JumpStar.
Mục tiêu của tôi là tạo ra engine AI siêu phàm đầu tiên cho cờ nhảy. Một đối thủ máy tính mạnh sẽ giúp mẹ tôi tiếp tục chơi ngay cả khi anh trai tôi và tôi không ở gần. Một engine AI siêu phàm thậm chí có thể khám phá ra những mô thức và chiến thuật mới, đẹp đẽ của trò chơi mà chưa nhiều người biết đến.
Đó cũng là lý do dự án được công khai. Một engine mạnh nhưng giữ riêng thì thú vị, nhưng người khác khó đánh giá hay cải thiện nó. Benchmark AI cờ nhảy công khai biến công trình này thành thứ ai cũng có thể kiểm chứng: một bộ luật, một giao thức, một bộ thế cờ, các engine cơ sở, nhật ký ván đấu và một mô hình JumpStar có tên cụ thể để các hệ thống khác thách đấu.
Vẻ đẹp của cờ nhảy
Cờ nhảy là một cuộc đua trên bàn cờ hình ngôi sao sáu cánh. Mỗi người chơi bắt đầu với một nhóm mười quân trong một tam giác và tìm cách đưa tất cả quân của mình sang tam giác đối diện trước tiên. Trò chơi dành cho hai, ba, bốn hoặc sáu người. Chỉ có hai kiểu di chuyển là đi một bước và nhảy, và không có cơ hội ăn quân. Đó là một lý do khiến bàn cờ luôn sống động: những luật di chuyển đơn giản tạo ra những dòng giao thông phức tạp khi người chơi cố xây chuỗi nhảy và ngăn đối thủ làm điều tương tự.
Dù tên tiếng Anh là Chinese Checkers, trò chơi này không bắt nguồn từ Trung Quốc và thực ra cũng không phải cờ đam. Nguồn gốc của nó thường được truy về Stern-Halma, hay Star Halma, một biến thể của trò Halma trên bàn cờ hình sao của Đức, được phát hành năm 1892. Cái tên tiếng Anh quen thuộc ra đời sau đó nhờ hoạt động tiếp thị ở Mỹ, và từ đó trò chơi trở nên phổ biến trên toàn thế giới.
Cách chơi cờ nhảy
Đến lượt mình, bạn di chuyển một quân. Quân cờ có thể đi một bước sang ô trống kề bên, hoặc nhảy qua một ô kề bên có quân để đáp xuống ô trống phía sau. Các bước nhảy có thể nối tiếp nhau, nên nếu khoảng cách phù hợp, chỉ một nước đi có thể vượt qua một phần lớn bàn cờ. Quân bị nhảy qua vẫn ở trên bàn, không bị ăn.
Mục tiêu là đưa tất cả quân của bạn vào tam giác nằm đối diện tam giác xuất phát. Chơi giỏi không chỉ là lao về phía trước. Bạn cần xây những chiếc thang hữu ích, tránh để quân mình chắn đường nhau, tận dụng tốt khu trung tâm đông đúc, và phán đoán khi nào một nước trông chậm lúc này lại tạo ra con đường nhanh hơn về sau.
Để tra cứu riêng về luật, hãy đọc luật cờ nhảy đầy đủ. Khi đã sẵn sàng nâng cao trình độ, hãy tiếp tục với hướng dẫn chiến lược và chiến thuật của JumpStar.
Vì sao AI cờ nhảy lại thú vị
Các trò chơi bàn cờ cổ điển đã là trọng tâm của AI suốt nhiều thập kỷ. Deep Blue của IBM đánh bại nhà vô địch cờ vua thế giới Garry Kasparov năm 1997. AlphaGo đánh bại Lee Sedol năm 2016. Những trò chơi ấy trở thành cột mốc vì máy tính chơi mạnh đã thay đổi cách con người hiểu về chúng.
Cờ nhảy chưa có được một hệ sinh thái AI công khai như vậy. So với cờ vua và cờ vây, số lượng engine, benchmark, bảng xếp hạng Elo, biên bản ván đấu công khai hay công cụ nghiên cứu dùng chung ít hơn rất nhiều. Khoảng trống ấy thật đáng ngạc nhiên, vì trò chơi có đúng kiểu cấu trúc mà các hệ thống AI thích nghiên cứu: thông tin hoàn hảo, không có yếu tố ngẫu nhiên, điều kiện thắng rõ ràng và vô số khả năng diễn biến trong tương lai.
Ngay cả thế khai cuộc yên tĩnh cũng phân nhánh rất nhanh. Trong bộ luật hai người của JumpStar, bàn cờ ban đầu có 14 nước đi đầu hợp lệ. Sau khi mỗi bên đi một nước, có 196 chuỗi hai nước khả dĩ. Đến độ sâu ba, có 4.760 chuỗi nước đi khả dĩ từ thế ban đầu. Về sau trong ván, các chuỗi nhảy và những làn đường đông đúc khiến lựa chọn kém hiển nhiên hơn nhiều so với vẻ đơn giản của luật chơi.
JumpStar là gì
JumpStar là một engine cờ nhảy được huấn luyện bằng tự đấu, xây dựng trên lõi luật/tìm kiếm C++20 gọn nhẹ, một mô hình mạng nơ-ron policy/value và thuật toán tìm kiếm cây Monte Carlo. Checkpoint công khai mạnh nhất của nó, JumpStar_60, hiện là nhà vô địch benchmark CCERL-2P10-v2. Điều bất ngờ nằm ở hiệu quả. Tất cả các mô hình JumpStar đều được huấn luyện trên một chiếc MacBook M4, chứ không phải trên những cụm TPU/GPU khổng lồ gắn liền với các hệ thống cờ vây và cờ vua mang tính cột mốc.
Tham vọng là đạt trình độ siêu phàm, nhưng tuyên bố công khai được cố ý đưa ra theo cách có thể kiểm chứng: JumpStar dường như đã đạt trình độ siêu phàm hoặc gần siêu phàm với bộ luật hai người, và CCERL tồn tại để các engine trong tương lai có thể thách thức kết quả đó.
Hệ thống
JumpStar không chỉ là một checkpoint mô hình. Đó là một hệ thống engine và benchmark hoàn chỉnh: biểu diễn bàn cờ, luật chơi, tìm kiếm, tự đấu, dữ liệu huấn luyện, công cụ trọng tài và bằng chứng công khai.
- Luật chơi và tìm kiếm. JumpStar dùng cách biểu diễn kiểu bitmap gọn nhẹ cho bàn cờ ngôi sao 121 ô, luật hai người chặt chẽ, sinh nước đi một bước và nhảy nhiều lần hợp lệ, khóa vùng đích, kiểm tra kết thúc ván, băm tất định, các bot cơ sở và một trình chạy trận đấu native. Phần cài đặt luật được cố ý viết tường minh vì nếu không, engine cờ nhảy có thể khai thác các trường hợp biên: cắm quân trong tam giác xuất phát hoặc vùng đích, tạo thế phong tỏa giả tạo, hoặc thắng nhờ kẽ hở của trọng tài thay vì nhờ chơi hay hơn. Bộ luật của JumpStar nhằm khuyến khích lối đua sòng phẳng, cảm quan hình học tốt và tìm kiếm có thể tái lập, thay vì các mánh chặn đường.
- Huấn luyện tự đấu. Tự đấu và phân tích lại tạo ra các trạng thái bàn cờ, nước đi hợp lệ, số lượt thăm MCTS, kết quả ván đấu và các đặc trưng tiến độ. Những dữ liệu đó huấn luyện một mô hình policy/value, và mô hình này định hướng vòng tìm kiếm tiếp theo.
JumpStar_60là một MLPgeometry_v1,512x4với khoảng10.36Mtham số, được huấn luyện từ bộ dữ liệu phân tích lại gồm1.8Mmẫu. Phần việc thực tế là làm cho vòng lặp đó đủ nhỏ và đủ nhanh để chạy lặp đi lặp lại trên phần cứng cá nhân. - Benchmark công khai. Vì cờ nhảy chưa có một bảng xếp hạng engine công khai hoàn thiện, tôi đã phát triển
CCERL-2P10-v2song song với JumpStar. CCERL xác định bộ luật, giao thức engine, bộ thế cờ cố định, các engine cơ sở, sản phẩm phát hành và phương pháp xếp hạng. Benchmark dùng các cặp thế cờ có đổi bên và công bố nhật ký ván đấu, nên kết quả có thể tái lập chứ không chỉ là lời khẳng định. Nhờ vậy, các engine trong tương lai có thể thách đấu JumpStar dưới cùng một trọng tài, thay vì so sánh những tuyên bố mơ hồ về sức mạnh.
JumpStar chơi cờ nhảy như thế nào
Một trong những quan sát định tính thú vị nhất là JumpStar thường không chơi như một heuristic chỉ biết đua đơn giản. Thay vào đó, nó phát triển những chiến thuật tinh vi như làm chậm đối thủ, giữ lại những quân chặn hữu ích và xây dựng các đội hình gần giống tam giác, chặt chẽ, hạn chế dòng di chuyển qua những hành lang quan trọng.
Phong cách đó rất dễ bị bỏ qua nếu chỉ xem cờ nhảy là một cuộc đua tiến về phía trước. Vì quân cờ không bao giờ bị ăn, một thế phòng thủ có thể phát huy tác dụng trong nhiều lượt: nó có thể chặn một chiếc thang nhảy, buộc đối thủ phải đi vòng qua chỗ tắc nghẽn, hoặc câu đủ thời gian để quân của chính mô hình về đích. Vì vậy, một số ý tưởng mạnh nhất của JumpStar có lẽ là về việc kiểm soát hình học, chứ không đơn thuần là tiến nhanh hơn.
Mô thức khai cuộc chiến thắng
| # | Người chơi | Kiểu | Nước đi |
|---|
Vòng lặp tìm kiếm và huấn luyện
Nhìn tổng quát, JumpStar đi theo mô hình AlphaZero: tự đấu tạo ra các mục tiêu lượt thăm MCTS, các mục tiêu đó huấn luyện mô hình policy/value, và mô hình mạnh hơn định hướng vòng tìm kiếm tiếp theo.
tự đấu -> mục tiêu lượt thăm MCTS -> huấn luyện policy/value -> tìm kiếm mạnh hơn -> tự đấu
Sức mạnh thực tế đến từ việc làm cho vòng lặp đó đủ rẻ để chạy lặp đi lặp lại: worker tự đấu bằng C++ native, sinh nước đi hiệu quả, đánh giá nút lá theo lô, bảng chuyển vị, tái sử dụng cây con, dữ liệu gọn nhẹ và các bản build phát hành được tinh chỉnh cho phần cứng Apple cá nhân.
Phần lớn sự rút ngắn đó đến từ việc dùng Codex với GPT-5.5 làm cộng sự triển khai và nghiên cứu. Codex giúp đọc hiểu mã nguồn, phân tích điểm nghẽn hiệu năng, viết lại các đoạn mã nóng, phân tích nhật ký huấn luyện, đóng gói các lượt chạy benchmark và giữ cho nhiều hướng thử nghiệm cùng tiến triển một lúc. Những cải thiện quan trọng nhất mang tính thực tế: tăng tốc đáng kể cho tự đấu và đánh giá, giảm khoảng 98% bộ nhớ trong quy trình huấn luyện để công việc vừa với máy cá nhân của tôi, và đủ tự động hóa để tiếp tục cải thiện engine trong khi tôi vẫn làm công việc toàn thời gian là CEO của Edia.
Dự án tiến triển nhanh khác thường vì vòng lặp ấy không chỉ là tự đấu cho mô hình; nó còn là một vòng lặp kỹ thuật lặp đi lặp lại cho cả hệ thống xung quanh. Codex giúp tôi chạy một thử nghiệm, xem xét kiểu lỗi, tối ưu mã, chạy lại benchmark, tóm tắt kết quả và biến câu hỏi tiếp theo thành một bản vá cụ thể. Chu trình phản hồi đó đã nén khối lượng công việc về hạ tầng, công cụ, frontend, benchmark và viết bài, vốn có thể mất hàng tháng, xuống còn khoảng một tuần tính từ lúc tìm thấy bàn cờ đến khi ra mắt công khai.
Số liệu thống kê Codex trên máy cho thấy sơ bộ quy mô của sự hợp tác này. Trên tất cả các luồng dự án hiển thị trong cơ sở dữ liệu trạng thái Codex cục bộ, tổng tokens_used được ghi nhận vào khoảng 559.9M token. Con số này bao gồm ngữ cảnh, đầu ra của công cụ, ảnh hưởng của ngữ cảnh được lưu đệm, phần tính toán suy luận/đầu ra và các luồng công việc chồng lấn, nên chỉ nên xem nó là một chỉ số về quy trình chứ không phải phép đo khoa học về lượng tính toán.
CCERL và benchmark công khai
Cờ nhảy chưa có một bảng xếp hạng engine công khai hoàn thiện như cờ vua và cờ vây, khiến việc đánh giá sức mạnh và tiến bộ của engine trở nên khó khăn. CCERL lấp đầy khoảng trống đó. CCERL là benchmark công khai đầu tiên để đánh giá sức mạnh của các engine AI cờ nhảy. Dựa trên những khái niệm tương tự từ cờ vua và cờ vây, CCERL cung cấp luật cố định, các thế khởi đầu đã được kiểm định, các cặp ván có đổi bên, nhật ký ván đấu có thể tải về và các engine cơ sở công khai.
Dựa trên benchmark CCERL, JumpStar dường như là engine AI cờ nhảy công khai mạnh nhất thế giới với cách biệt rất lớn.
Tôi tin rằng JumpStar đã đạt sức mạnh cờ nhảy gần siêu phàm với bộ luật hai người, chỉ dùng sức tính toán cỡ một chiếc MacBook. Quan trọng hơn, CCERL mang đến cho mọi người đóng góp trong tương lai một mục tiêu: chỉnh sửa JumpStar, xây dựng mô hình mới, chuyển thể một engine có sẵn sát hơn, bổ sung các thế cờ tốt hơn, hoặc gửi một đối thủ thách đấu dưới cùng một trọng tài.
Hướng phát triển
JumpStar không chỉ nhằm là một bot riêng tư. Dự án đang hướng tới trở thành bốn điều:
- Một mô hình AI công khai mạnh mẽ. JumpStar có giấy phép mở, và trang web này miễn phí. Ai cũng có thể đấu với JumpStar hoặc tự mình tìm cách cải thiện nó. JumpStar được huấn luyện hoàn toàn trên một chiếc MacBook M4. Có thêm sức tính toán chắc chắn sẽ cải thiện hiệu năng.
- Hạ tầng benchmark công khai. Cờ vua và cờ vây có những cộng đồng nơi các engine được kiểm tra, so sánh và cải thiện. CCERL mang hạ tầng tương tự đến với cờ nhảy: luật rõ ràng, trận đấu có thể tái lập, nhật ký công khai và một lối đi để người khác xây dựng mô hình của riêng họ.
- Nghiên cứu về chính trò chơi. AI mạnh thay đổi những gì chúng ta có thể nhìn thấy. Tôi muốn hiểu lối chơi hay trông như thế nào, các khai cuộc phát triển ra sao, vì sao bàn cờ đông đúc lại vận hành như vậy, và điều gì xảy ra trong ván ba, bốn và sáu người khi khu giữa bàn cờ trở thành một nút thắt giao thông đầy khả năng.
- Các biến thể nhiều người chơi. Mô hình hai người chỉ là khởi đầu. Những câu hỏi hấp dẫn hơn bắt đầu khi bàn cờ đông hơn: ba người, bốn người, sáu người, những liên minh thay đổi, những con đường bị chặn và những khai cuộc kỳ lạ tự nảy sinh. Tôi muốn tìm hiểu lối chơi mạnh trông như thế nào ở đó, và cả trên những bàn cờ lớn hơn nhiều so với tiêu chuẩn. Những sự phức tạp và mô thức xuất hiện sẽ khiến người ta mê mẩn.
Tôi hy vọng JumpStar sẽ khuyến khích nhiều người hơn nghĩ về cờ nhảy, chơi nó, nghiên cứu nó và xây dựng thêm nhiều thứ xoay quanh nó.