About onlymove.net
This project was created by Henry Hemming and started on July 12th, 2025.
Problem Details
- The ruleset is Japanese, with a 6.5 point komi.
- Problems are generated by KataGo during self-play, with moves chosen to be intuitive while maintaining balance in the game.
- To ensure quality, each problem is checked by the KataGo model
kata1-b18c384nbt-s9996604416-d4316597426. The model uses 1,000 playouts to verify that the best move wins, and another 1,000 playouts to verify no other move wins.
- Two board sizes are available: 9×9 at onlymove.net/9 and 13×13 at onlymove.net/13. The collection contains over 220,000 unique problems (about 107,000 on 9×9 and 114,000 on 13×13). Each problem can be displayed in any of eight orientations.
- Each problem's difficulty is set by a neural network whose training goal is to best fit how real people actually solve. It is trained on the outcomes of players' first-time attempts — the real right/wrong record — so a problem's rating reflects the strength at which humans genuinely clear it rather than any theoretical measure of hardness. Its inputs are KataGo's internal read of the position (the same representation the skill axes are built from) and how well a range of KataGo configurations solve the problem — including
b18c384nbt-humanv0 at various rank settings and kata1-b18c384nbt-s9996604416-d4316597426 at various temperatures. From these inputs the network predicts a rating for every problem. The network learns its own difficulty scale, easy-guess floor, and reliability ceiling from the data, and a single network rates both board sizes on one shared scale.
- A problem's rating is the player strength at which it is solved about 80% of the time, not 50% — so the rating reflects the level needed to clear it reliably rather than to merely have a coin-flip chance.
- To turn ratings into ranks, players are occasionally asked their rank on the servers they play on. These declarations calibrate the rating-to-rank curve and map your rank onto each server's own scale, so the rank you see corresponds to real-world ranks rather than abstract numbers.
How accurate are the ratings?
The rating model is checked against players' self-declared ranks on other servers. It is also validated on held-out problems it never trains on, and the check is repeated over several independent runs — each retraining the model from scratch with a different randomly drawn 10% of problems set aside — to confirm it generalizes to unseen positions rather than memorizing, and that the result does not hinge on any one lucky split.
- Rank vs. real-world rank. Comparing each player's model rating against the rank they declared on other servers gives a Spearman rank correlation of about 0.83 (±0.03), across roughly 420 declarations from about 220 players. In plain terms: order players by our rating and you get very nearly the same order as their actual rank.
- How close the shown rank lands. Comparing the server rank we show each player against the rank they actually declared there, about 29% of declarations fall within one rank of the declared value and 54% within two ranks (each ±3 points).
- What that is worth in games. A rank of error is hard to judge in the abstract, so the same comparison is also expressed as a tournament record: how many games a conventional rating would need in order to be this accurate. Based on published statistics from the European Go Database, and measured on the players who tell us a European rank, the rank we show agrees with a player's real rank about as closely as two independent ratings built from about 12 tournament games (±2) agree with each other. One game between dan players settles far more than one between kyu players, so the figure describes that group rather than everyone.
Both figures rest on a few hundred self-declarations, so each carries the sampling margin shown. A difference smaller than that between one refit and the next is noise, not movement.
The full technical account — how the ratings, the ranks and the weakness dimensions are built, and how the app uses them — is in the methodology.
Why train this way?
Fitting difficulty to real human results, targeting an ~80% success rate, and reviewing at a constant recall probability are not arbitrary choices — each rests on findings from the learning-science literature.
- Studying positions builds strength more than playing does. In a large study of chess players, the hours spent on serious solitary study — analyzing decision points away from actual games — predicted playing strength better than the number of tournament games played (Charness, Tuffiash, Krampe, Reingold & Vasyukova, 2005). A position is exactly that kind of isolated decision point, distilled so that every move is a genuine reading exercise. That is the case for practicing them at all — and for the whole approach being built around solving, not just playing.
- Small boards sit between the two things known to transfer. Solving tsumegos and playing games each transfer to real playing strength on their own — playing is, after all, transfer to itself. Problems on 9×9 and 13×13 boards sit on the spectrum between them and keep what each does best: the breadth and variety of a real game, with whole-board reading, direction of play and the endgame all in one position, and the instant, unambiguous feedback of a tsumego — one move is correct, and you learn which at once.
- Aim for about 80% success on new problems. Learning is fastest when training is neither too easy nor too hard: for a broad class of learning systems the sweet spot sits near an 85% success rate — fail much more and the material is mostly noise, succeed much more and there is little left to learn (Wilson, Shenhav, Straccia & Cohen, 2019). Where exactly that optimum falls shifts with how much noise the task carries, and analyses that optimize the whole practice schedule land on a similar target that depends on those parameters (Ye, Su & Cao, 2022). For the noisy, one-shot reading a position demands, that points a little below 85%, so onlymove targets about 80%: a problem's rating is defined as the strength at which it is cleared 80% of the time, and problem selection keeps you near that level.
- Review at a constant recall probability. The most effective spaced-repetition schedules bring an item back not on a fixed calendar but whenever your chance of still remembering it has decayed to a constant target — reviewing each item in proportion to how quickly you personally forget it (Tabibian, Upadhyay, De, Zarezade, Schölkopf & Gomez-Rodriguez, 2019). onlymove applies the same principle at the same ~80% level: a failed problem returns when it estimates roughly an 80% chance you still remember the solution, so each review lands at the moment it does the most good.
Ranking System
- Your rank is a maximum-likelihood estimate of your strength, fitted over your recent solving history — roughly your last few hundred first-time problems, with the most recent weighted most heavily — and recomputed after every problem. Problems that sharply separate strengths move it more than ambiguous ones do.
- It moves quickly while you have little history and settles as more evidence accumulates. A new account starts at 20 kyu, so a player stronger than that climbs away from it at roughly one rank per problem, slowing as the estimate closes in on your real strength.
- The rank on the front page reads only that recent window. The stats screen's Rank tab plots both views across your whole career: your front-page rank over time as a solid line, and a smoothed long-term "Stable rank" curve with a band showing how precisely each point is known. Because the front-page rank reflects your recent form while the stable curve spans everything, the two can differ, most visibly during onboarding when the live rank is still catching up.
- Even high-rank problems can be guessed correctly, but not frequently enough (4/5) to maintain your rank.
- To help you learn, problems you fail are shown again later, whenever the system thinks you have an 80% chance of remembering the solution.
- Answering problems that are from links and not part of your own progression does not affect your rank.
Features
- It can be installed from your browser as a standalone app.
- You can log in to the same account from multiple devices; your solving history and rank stay in sync everywhere you play.
- The review mode has numerous positions pre-evaluated by
kata1-b18c384nbt-s9996604416-d4316597426 with a minimum of 30 playouts, usually hundreds of playouts.
- For positions that have not been pre-evaluated, a server analyzes them with
kata1-b18c384nbt-s9996604416-d4316597426 at 30 playouts; only under load does it drop to 1 playout, and it tells you when that happens.
- Upon failure, if you played too fast and you get better results when you think for longer, a slow red screen will appear.
- Upon failure, if you failed a repeat problem, for which you didn't spend much time reviewing, and you get better results when you spend more time reviewing the solution, a slow red screen will appear.
- Problem selection learns from your attempt history. Every position is scored along a small set of skill axes — currently seven, covering life and death, the endgame, ko, the opening, tenuki, sente, and capturing races — learned from real players' results on top of KataGo's internal read of the position, so each axis captures a way players genuinely differ. Upcoming problems tilt toward the skills that have been tripping you up. When you pick the wrong move, the move you actually played is scored on the same axes, so the system can distinguish "the position is hard to read" from "you over- or under-play this kind of move" — and problem selection uses that direction, favoring skills you under-play rather than serving more of what you already over-play.
- Push notifications can be enabled to remind you when failed problems are due for review.
- A Community tab shows anonymous server-wide statistics over the past week — overall activity, the rank distribution, time usage, and how quickly players return to failed problems — with your own position highlighted.
- A weekly leaderboard ranks everyone active in the past 7 days by predicted rank, shown in the units of the Go server you pick. Entries are anonymous with only a country flag, unless a player links their real-world (e.g. EGF) profile, which also puts their declared rank beside the prediction.
- The statistics page tracks factors influencing your problem-solving probability. Ideally, time-related metrics should be close to zero, while a positive trend in the "per problem solved" metric indicates learning. It also shows a per-attempt rating-history chart, a smoothed long-term skill estimate with a 95% confidence band, a session-to-session form variance metric, and a sorted list of skills you tend to misplay described in plain sentences.
- You can see your estimated rank on various Go servers — how your strength would read on each server's own scale — from the Rank tab's server selector or by tapping your front-page rank. Your front-page (onlymove) rank is not adjusted for solving speed, but each server's rank is: here, taking more time genuinely makes you more likely to solve a problem, so your front-page rank credits that; but in a real game a slower time control doesn't make you more likely to win — your opponent gets the same extra time and is just as much stronger for it — so a player who leans on long thinking reads a little weaker on a timed server.
- Accessibility: moves can be played entirely from a physical keyboard — type a move's board coordinates, e.g.
C3, anywhere in the app and press Enter to play it (columns skip I, rows count from the bottom; works while solving and while reviewing). Tiny coordinate labels line the very edge of the board, and every control is keyboard-operable. Designed for players who find precise tapping or mouse work difficult.
Changelog
See the full changelog for the complete history of updates.
关于 onlymove.net
本项目由 Henry Hemming 创建,始于 2025 年 7 月 12 日。
题目详情
- 规则采用日本规则,贴目 6.5 目。
- 题目由 KataGo 在自我对弈过程中生成,落子力求直观,同时保持棋局的平衡。
- 为确保质量,每道题目都会经过 KataGo 模型
kata1-b18c384nbt-s9996604416-d4316597426 的检验。该模型使用 1,000 次模拟推演来验证最佳一手能够取胜,再用另外 1,000 次模拟推演来验证没有其他着法能够取胜。
- 提供两种棋盘尺寸:9×9 位于 onlymove.net/9,13×13 位于 onlymove.net/13。题库收录了超过 220,000 道各不相同的题目(约 107,000 道为 9×9,114,000 道为 13×13)。每道题目可以以八种方向中的任意一种呈现。
- 每道题目的难度由一个神经网络设定,其训练目标是尽可能贴合真实的人类实际解题情况。它以玩家首次尝试的结果——真实的对错记录——为训练依据,因此题目的评分反映的是人类真正能够攻克它的棋力,而非任何理论上的难度衡量。它的输入包括 KataGo 对局面的内部解读(与技能轴所用的表示相同),以及一系列 KataGo 配置解出该题的表现——包括在各种段位设置下的
b18c384nbt-humanv0 以及在各种温度下的 kata1-b18c384nbt-s9996604416-d4316597426。网络根据这些输入为每道题目预测一个评分。该网络从数据中学习出自己的难度尺度、易猜下限和可靠度上限,并由单一网络在同一套共享尺度上对两种棋盘尺寸进行评分。
- 题目的评分是能以约 80%(而非 50%)的概率解出它的玩家棋力——因此评分反映的是可靠地攻克它所需的水平,而不仅仅是拥有五五开机会所需的水平。
- 为了将评分转换为段级位,我们会偶尔询问玩家他们在所对弈服务器上的段级位。这些申报用于校准评分到段级位的曲线,并将你的段级位映射到每个服务器各自的尺度上,因此你所看到的段级位对应的是现实世界中的段级位,而非抽象的数字。
评分有多准确?
评分模型会对照玩家在其他服务器上自行申报的段级位进行检验。它还会在从不参与训练的留出题目上进行验证,并且这一检验会在多次独立运行中重复——每次都随机抽取不同的 10% 题目留出,并从零开始重新训练模型——以确认它能够泛化到未见过的局面而非死记硬背,且结果不依赖于某一次侥幸的划分。
- 段级位与现实段级位的对比。将每位玩家的模型评分与他们在其他服务器上申报的段级位进行比较,可得到约 0.83(±0.03)的斯皮尔曼等级相关系数,其数据来自约 220 位玩家的大约 420 份申报。通俗地说:按我们的评分给玩家排序,得到的顺序与他们实际段级位的顺序几乎完全一致。
- 所显示段级位的接近程度。将我们为每位玩家显示的服务器段级位与他们在该服务器实际申报的段级位相比较,约 29% 的申报落在申报值一个段级位以内,54% 落在两个段级位以内(各 ±3 个百分点)。
- 这相当于多少盘棋。用段级位表示的误差很难有直观感受,因此我们也把同一比较换算成比赛场次:一套常规的等级分体系需要多少盘对局才能达到同样的准确度。根据欧洲围棋数据库(EGD)公布的统计数据,并在告知我们欧洲段级位的玩家上测量,我们所显示的段级位与玩家真实段级位的吻合程度,大致相当于两份各自基于约 12 盘比赛对局(±2)建立的独立等级分之间的吻合程度。一盘段位棋手之间的对局所提供的信息远多于一盘级位棋手之间的对局,因此该数字描述的是前一类玩家,而非所有人。
这两项数据都基于数百份自行申报,因此各自带有上述抽样误差范围。两次重新拟合之间小于该范围的差异属于噪声,而非真实变化。
关于评分、段级位与弱项维度如何构建、以及应用如何使用它们的完整技术说明,见方法论(英文)。
为何这样训练?
将难度拟合到真实的人类结果、以约 80% 的成功率为目标、以及以恒定的记忆概率进行复习,都不是随意的选择——每一项都建立在学习科学文献的研究发现之上。
- 研究局面比对弈更能增长棋力。在一项针对国际象棋棋手的大型研究中,用于认真独自钻研的时间——即在实战之外分析决策节点——比参加的比赛对局数更能预测棋力(Charness, Tuffiash, Krampe, Reingold & Vasyukova, 2005)。一道局面恰恰就是这样一个孤立的决策节点,经过提炼,使得每一手都是一次真正的计算练习。这既是练习它们本身的理由——也是整个方法围绕解题而非仅仅对弈来构建的理由。
- 小棋盘处于两种已知能够迁移的训练方式之间。做诘棋与实际对弈各自都能独立地迁移到真实棋力——对弈本身当然就是对自身的迁移。9×9 和 13×13 的题目正处于两者之间的连续谱上,并保留了各自的长处:既有实战般的广度与多样性——全局计算、行棋方向与官子尽在同一局面之中——又有诘棋般即时且明确的反馈:只有一手是正解,而你立刻就能知道是哪一手。
- 在新题目上以约 80% 的成功率为目标。当训练既不太易也不太难时,学习最快:对一大类学习系统而言,最佳点落在约 85% 的成功率附近——失败得多则材料多为噪声,成功得多则所剩无几可学(Wilson, Shenhav, Straccia & Cohen, 2019)。那个最佳点具体落在何处,会随任务所带噪声的多少而变化,而对整个练习计划进行优化的分析也得出一个依赖于这些参数的相似目标(Ye, Su & Cao, 2022)。对于一道局面所要求的充满噪声、一次性的计算而言,这一目标略低于 85%,因此 onlymove 以约 80% 为目标:题目的评分被定义为能以 80% 的概率攻克它的棋力,而题目的选取会让你保持在该水平附近。
- 以恒定的记忆概率进行复习。最有效的间隔重复计划并非按固定的日程、而是在你仍然记得某项内容的概率衰减到一个恒定目标时才把它重新提出——按你个人遗忘它的快慢成比例地复习每一项(Tabibian, Upadhyay, De, Zarezade, Schölkopf & Gomez-Rodriguez, 2019)。onlymove 在同样约 80% 的水平上应用相同的原理:一道做错的题目会在系统估计你仍有约 80% 的概率记得解法时重新出现,因此每次复习都恰好落在它最有裨益的时刻。
段级位系统
- 你的段级位是对你棋力的最大似然估计,拟合自你近期的解题记录——大致是你最近数百道首次尝试的题目,其中最新的题目权重最高——并在每道题之后重新计算。能明显区分棋力高低的题目,比模棱两可的题目对它的影响更大。
- 当你记录尚少时,它变动很快,随着证据积累而逐渐稳定。新账号从 20 级起步,因此比这更强的玩家会从那里上升,大致每做一题就上升一级,而随着估计逐渐逼近你的真实棋力,上升会放慢。
- 首页上的段级位只读取近期这一窗口。统计界面的“段级位”选项卡则绘制贯穿你整个生涯的两种视图:以实线表示你首页段级位随时间的变化,以及一条平滑的长期“稳定段级位”曲线,并带有一条误差带显示每个点的已知精确程度。由于首页段级位反映的是你近期的状态,而稳定曲线涵盖了全部记录,两者可能有所不同,在新手入门阶段实时段级位仍在追赶时最为明显。
- 即使是高段级位的题目也可能被蒙对,但蒙对的频率(4/5)不足以维持你的段级位。
- 为帮助你学习,你做错的题目会在系统认为你有 80% 的概率记得解法时再次出现。
- 解答来自分享链接、并非你自身进程一部分的题目,不会影响你的段级位。
功能
- 它可以从你的浏览器安装为一个独立的应用。
- 你可以在多台设备上登录同一账号,解题记录和段级位会在各处保持同步。
- 复习模式中有大量局面已由
kata1-b18c384nbt-s9996604416-d4316597426 预先评估,评估至少使用 30 次模拟推演,通常是数百次模拟推演。
- 对于尚未预先评估的局面,会由一台服务器让
kata1-b18c384nbt-s9996604416-d4316597426 以 30 次模拟推演进行分析;只有在负载较高时才会降至 1 次模拟推演,并且会告知你。
- 做错时,如果你下得太快、而思考更久能得到更好的结果,就会出现一个缓慢的红色屏幕。
- 做错时,如果你做错的是一道重复出现的题目、且你在复习上花的时间不多、而花更多时间复习解法能得到更好的结果,就会出现一个缓慢的红色屏幕。
- 题目选取会从你的尝试记录中学习。每个局面都会在少数几条技能轴上打分——目前共有七条,涵盖死活、官子、打劫、布局、脱先、先手与对杀——这些轴以 KataGo 对局面的内部解读为基础、根据真实玩家的解题结果学习而来,因此每条轴都对应着玩家之间真实存在的差异。接下来的题目会向那些一直让你栽跟头的技能倾斜。当你选错着法时,你实际下的那一手也会在相同的轴上打分,因此系统能够区分“这个局面难以计算”和“你对这类着法下得过多或过少”——而题目选取会利用这一方向,偏向你下得过少的技能,而不是继续提供更多你已经下得过多的类型。
- 可以启用推送通知,在做错的题目到复习时间时提醒你。
- “社区”选项卡展示过去一周内全服匿名的统计数据——总体活跃度、段级位分布、时间使用情况,以及玩家回头重做错题的快慢——并突出显示你自己的位置。
- 每周排行榜按预测段级位列出过去 7 天内活跃的所有玩家,可切换为你选择的围棋服务器的段级位单位显示。条目默认匿名、只显示国旗,除非玩家关联自己现实中的(例如 EGF)档案,关联后预测旁还会显示其申报段级位。
- 统计页面追踪影响你解题概率的各项因素。理想情况下,与时间相关的指标应接近于零,而“每解出一题”指标呈正向趋势则表明有所学习。它还展示一张逐次尝试的评分历史图表、一个带 95% 置信带的平滑长期棋力估计、一个逐次对局间的状态方差指标,以及一份用平实语句描述、按你倾向下错的技能排序的清单。
- 你可以查看自己在各个围棋服务器上的估计段级位——即你的棋力在每个服务器各自的尺度上会如何呈现——方式是通过“段级位”选项卡的服务器选择器,或点按你的首页段级位。你的首页(onlymove)段级位不会因解题速度而调整,但每个服务器的段级位会:在这里,花更多时间确实会让你更可能解出一道题目,因此你的首页段级位会认可这一点;但在真实对局中,更慢的用时规则并不会让你更可能获胜——你的对手也获得同样多的额外时间,因而相应地更强——所以一个依赖长考的玩家,在有时限的服务器上会显得稍弱一些。
- 无障碍功能:着手可以完全通过实体键盘完成——在应用中的任意位置输入着手的棋盘坐标(如
C3)并按回车即可落子(列字母跳过 I,行号从下往上数;解题和复习时均可使用)。棋盘最边缘标有极小的坐标标记,且所有控件均可通过键盘操作。专为难以精确点按或使用鼠标的玩家设计。
更新日志
查看完整更新日志以了解全部更新历史。
onlymove.net について
このプロジェクトは Henry Hemming によって作成され、2025年7月12日に始まりました。
問題について
- ルールは日本ルールで、コミは6.5目です。
- 問題は KataGo が自己対局を行う中で生成され、局面のバランスを保ちながら直感的な着手が選ばれます。
- 品質を保証するため、各問題は KataGo のモデル
kata1-b18c384nbt-s9996604416-d4316597426 によって検証されます。このモデルは1,000回のプレイアウトで最善手が勝つことを確認し、さらに1,000回のプレイアウトで他のどの手でも勝てないことを確認します。
- 盤のサイズは2種類あります。9×9 は onlymove.net/9、13×13 は onlymove.net/13 でプレイできます。コレクションには220,000問を超えるユニークな問題が収録されています(9×9 が約107,000問、13×13 が約114,000問)。各問題は8種類の向きのいずれかで表示できます。
- 各問題の難易度は、実際の人々がどのように問題を解くのかに最もよく適合することを学習目標としたニューラルネットワークによって設定されます。プレイヤーが初めて挑戦したときの結果、つまり実際の正誤の記録をもとに学習されるため、問題のレーティングは難しさの理論的な尺度ではなく、人間が実際にその問題を解けるようになる棋力を反映しています。入力となるのは、KataGo による局面の内部的な読み(スキル軸に用いられるのと同じ表現)と、さまざまな KataGo の設定がその問題をどれだけよく解くか(さまざまな棋力設定の
b18c384nbt-humanv0 や、さまざまな温度設定の kata1-b18c384nbt-s9996604416-d4316597426 を含みます)です。これらの入力から、ネットワークが各問題のレーティングを予測します。ネットワークは難易度の尺度、当てずっぽうで正解しうる下限、信頼性の上限をデータから自ら学習し、単一のネットワークが両方の盤サイズを一つの共通の尺度で評価します。
- 問題のレーティングは、その問題が50%ではなく約80%の確率で解かれるプレイヤーの棋力です。つまりレーティングは、単に五分五分の可能性を持つ棋力ではなく、確実に解くために必要な水準を反映しています。
- レーティングを段級位に変換するため、プレイヤーには時折、利用しているサーバーでの段級位を尋ねます。これらの申告はレーティングと段級位の変換曲線を較正し、あなたの段級位を各サーバー独自の尺度に対応づけます。そのため表示される段級位は、抽象的な数値ではなく現実の段級位に対応します。
レーティングの精度は?
レーティングモデルは、プレイヤーが他のサーバーで自己申告した段級位と照合して検証されます。また、学習に一切使用しない問題を取り分けた検証も行っており、この検証は複数の独立した実行で繰り返されます——そのたびにランダムに選び直した10%の問題を取り分け、モデルをゼロから学習し直します——。これにより、丸暗記ではなく未知の局面へ一般化できること、そして結果が特定の偶然の分割に依存しないことを確認しています。
- 段級位と現実の段級位の比較。 各プレイヤーのモデルレーティングを、その人が他のサーバーで申告した段級位と比較すると、約220人のプレイヤーによる約420件の申告全体で、スピアマンの順位相関は約0.83(±0.03)となります。分かりやすく言えば、当サイトのレーティングでプレイヤーを並べると、実際の段級位による順序とほぼ同じ順序になります。
- 表示される段級位の近さ。 各プレイヤーに表示するサーバー段級位を、その人がそのサーバーで実際に申告した段級位と比較すると、申告のうち約29%が申告値の1段級位以内に、54%が2段級位以内に収まります(それぞれ±3ポイント)。
- それは何局分に相当するか。 段級位で表した誤差は直感的に評価しにくいため、同じ比較を対局数にも換算しています。すなわち、通常のレーティングが同じ精度に達するには何局を要するか、ということです。欧州囲碁データベース(EGD)が公表している統計に基づき、欧州の段級位を申告しているプレイヤーで測定すると、当サイトが表示する段級位と実際の段級位との一致度は、それぞれ約12局(±2)の大会対局から作られた2つの独立したレーティング同士の一致度とほぼ同じです。段位者同士の1局は級位者同士の1局よりはるかに多くを決めるため、この数字は前者の層について述べたものであり、全員に当てはまるわけではありません。
いずれの数値も数百件の自己申告に基づいており、それぞれ上記の標本誤差を伴います。再学習ごとの差がその範囲より小さい場合、それは実際の変化ではなく誤差です。
レーティング、段級位、弱点の各軸をどのように構築し、アプリがそれらをどう使っているかの詳しい技術解説は方法論(英語)にあります。
なぜこのように学習させるのか?
難易度を実際の人間の結果に適合させること、約80%の正解率を目標とすること、そして一定の記憶保持確率で復習することは、恣意的な選択ではありません。いずれも学習科学の文献における知見に基づいています。
- 局面を研究することは、対局するよりも棋力を高めます。 チェスプレイヤーを対象とした大規模な研究では、真剣に一人で研究に費やした時間、つまり実際の対局から離れて決断の場面を分析した時間の方が、参加したトーナメントの対局数よりも棋力をよく予測しました(Charness, Tuffiash, Krampe, Reingold & Vasyukova, 2005)。局面とはまさにそうした独立した決断の場面であり、あらゆる着手が本物の読みの練習となるよう凝縮されています。これが、そもそも局面を練習する理由であり、また対局するだけでなく問題を解くことを中心にこのアプローチ全体が組み立てられている理由です。
- 小さな盤は、転移が知られている二つのものの間に位置します。 詰碁を解くことと対局することは、それぞれ単独でも実際の棋力へ転移します。対局はいわば自分自身への転移です。9路と13路の問題はその二つの間のスペクトル上に位置し、双方の長所を保っています。実戦のような幅広さと多様性、つまり全局の読み、着手の方向、ヨセが一つの局面に収まっていることと、詰碁のような即時で明確なフィードバック、つまり正解は一手であり、それがどれかをすぐに知ることができることです。
- 新しい問題では約80%の正解率を目指します。 学習は、訓練が易しすぎず難しすぎないときに最も速く進みます。幅広い種類の学習システムにおいて、最適点は85%前後の正解率にあります。これより大きく失敗すると教材はほとんどノイズとなり、これより大きく成功すると学ぶべきことがほとんど残りません(Wilson, Shenhav, Straccia & Cohen, 2019)。その最適点が正確にどこに来るかは、その課題がどれだけノイズを含むかによって変わり、練習スケジュール全体を最適化する分析も、これらのパラメータに依存する同様の目標値に落ち着きます(Ye, Su & Cao, 2022)。局面が要求するノイズの多い一発勝負の読みにおいては、それは85%をやや下回る値を指すため、onlymove は約80%を目標としています。問題のレーティングは、その問題が80%の確率で解かれる棋力として定義され、問題選択によってあなたはその水準の近くに保たれます。
- 一定の記憶保持確率で復習します。 最も効果的な間隔反復のスケジュールは、決まったカレンダーに従ってではなく、その項目をまだ覚えている確率が一定の目標値まで低下したときに項目を再び提示します。つまり各項目を、あなた自身がどれだけ早く忘れるかに比例して復習します(Tabibian, Upadhyay, De, Zarezade, Schölkopf & Gomez-Rodriguez, 2019)。onlymove は同じ原理を同じく約80%の水準で適用します。間違えた問題は、あなたがまだ解法を覚えている確率が約80%と推定されたときに再び出題されるため、各復習が最も効果を発揮する瞬間に行われます。
段級位システム
- あなたの段級位は、あなたの最近の解答履歴(おおよそ直近の数百問の初挑戦の問題で、最近のものほど重く重み付けされます)に基づいて当てはめられた、あなたの棋力の最尤推定値であり、問題を解くたびに再計算されます。棋力を鋭く区別する問題は、曖昧な問題よりも段級位を大きく動かします。
- 履歴が少ないうちは素早く動き、証拠が蓄積するにつれて安定します。新しいアカウントは20級から始まるため、それより強い方はそこからおおよそ1問につき1ランクのペースで上がっていき、推定があなたの本当の棋力に近づくにつれて緩やかになります。
- トップページの段級位は、その最近の範囲のみを読み取ります。統計画面の「段級位」タブは、あなたの全履歴にわたって両方の見方を描画します。トップページの段級位の時間変化を実線で、そして平滑化された長期的な「安定段級位」曲線を、各点がどれだけ正確に分かっているかを示す帯とともに描きます。トップページの段級位が最近の調子を反映するのに対し、安定曲線はすべてを網羅するため、両者は異なることがあります。これは、ライブの段級位がまだ追いついている最中の導入期に最も顕著に現れます。
- 高段級位の問題でも当てずっぽうで正解することはありますが、あなたの段級位を維持できるほど頻繁(5回中4回)ではありません。
- 学習を助けるため、間違えた問題は、あなたが解法を覚えている確率が80%だとシステムが判断したときに、後で再び出題されます。
- リンクから開いた、あなた自身の学習の一部ではない問題に解答しても、あなたの段級位には影響しません。
機能
- ブラウザからスタンドアロンアプリとしてインストールできます。
- 複数のデバイスから同じアカウントにログインでき、解答履歴と段級位はどこでも同期されます。
- 検討モードでは、多数の局面が
kata1-b18c384nbt-s9996604416-d4316597426 によって、最低30回、通常は数百回のプレイアウトであらかじめ評価されています。
- あらかじめ評価されていない局面については、サーバーが
kata1-b18c384nbt-s9996604416-d4316597426 を用いて30回のプレイアウトで分析します。負荷が高いときのみ1回のプレイアウトに下がりますが、その際はその旨が表示されます。
- 間違えたとき、あなたが早く打ちすぎていて、長く考えた方がよい結果になる場合には、ゆっくりとした赤い画面が表示されます。
- 間違えたとき、復習にあまり時間をかけなかった再出題の問題を間違え、解法の復習にもっと時間をかけた方がよい結果になる場合には、ゆっくりとした赤い画面が表示されます。
- 問題選択はあなたの挑戦履歴から学習します。すべての局面は少数のスキル軸——現在は7本で、死活、ヨセ、コウ、序盤、手抜き、先手、攻め合いをカバーします——の上で採点されます。これらの軸は KataGo による局面の内部的な読みをもとに、実際のプレイヤーの解答結果から学習されたもので、各軸はプレイヤー間に実際に存在する差を捉えています。今後の問題は、あなたがつまずいているスキルの方へ傾きます。あなたが誤った手を選ぶと、実際に打った手も同じ軸の上で採点されるため、システムは「その局面が読みにくい」ことと「あなたがこの種の手を打ちすぎている/打たなすぎている」ことを区別できます。そして問題選択はその方向を利用し、あなたがすでに打ちすぎているものをさらに出題するのではなく、打たなすぎているスキルを優先します。
- プッシュ通知を有効にすると、間違えた問題が復習の時期になったときに知らせてくれます。
- 「コミュニティ」タブでは、過去1週間にわたるサーバー全体の匿名統計、つまり全体の活動状況、段級位の分布、時間の使い方、そしてプレイヤーが間違えた問題にどれだけ早く戻ってくるかが、あなた自身の位置を強調して表示されます。
- 毎週のリーダーボードには、過去7日間にプレイしたすべてのプレイヤーが予測段級位順に表示され、任意の囲碁サーバーの単位に切り替えられます。エントリは国旗のみの匿名ですが、プレイヤーが実世界の(例えば EGF の)プロフィールと自分を関連付けると、予測の横に申告段級位も表示されます。
- 統計ページは、あなたが問題を解ける確率に影響する要因を追跡します。理想的には、時間に関連する指標はゼロに近いのが望ましく、一方「問題を解くごと」の指標が正の傾向を示していれば学習が進んでいることを表します。また、挑戦ごとのレーティング履歴のグラフ、95%信頼区間の帯を伴う平滑化された長期的な棋力推定、セッションごとの調子のばらつきの指標、そしてあなたが打ち間違えやすいスキルを平易な文章で説明した並べ替え済みの一覧も表示されます。
- 「段級位」タブのサーバー選択、またはトップページの段級位をタップすることで、さまざまな囲碁サーバーでの推定段級位、つまりあなたの棋力が各サーバー独自の尺度でどう読み取られるかを確認できます。トップページ(onlymove)の段級位は解答の速さに合わせて調整されませんが、各サーバーの段級位は調整されます。ここでは、時間をかけることが実際に問題を解ける可能性を高めるため、トップページの段級位はそれを反映します。しかし実際の対局では、遅い持ち時間だからといって勝ちやすくなるわけではありません。相手も同じだけ余分な時間を得て、その分だけ同じように強くなるからです。そのため、長考に頼るプレイヤーは、持ち時間のあるサーバーではやや弱く読み取られます。
- アクセシビリティ:着手は物理キーボードだけで行えます——アプリ内のどこでも碁盤の座標(例:
C3)を入力して Enter キーを押すと、その点に着手できます(列の文字は I を飛ばし、行番号は下から数えます。解答中でも検討中でも使えます)。碁盤の最端には極小の座標ラベルが表示され、すべての操作はキーボードで行えます。正確なタップやマウス操作が難しいプレイヤーのために設計されています。
変更履歴
更新の全履歴については、変更履歴の全文をご覧ください。
onlymove.net 소개
이 프로젝트는 Henry Hemming이 만들었으며 2025년 7월 12일에 시작되었습니다.
문제 상세
- 규칙은 일본 규칙이며, 덤은 6.5집입니다.
- 문제는 KataGo가 자체 대국을 하는 동안 생성되며, 게임의 균형을 유지하면서도 직관적인 수를 고르도록 합니다.
- 품질을 보장하기 위해 각 문제는 KataGo 모델
kata1-b18c384nbt-s9996604416-d4316597426으로 검증됩니다. 이 모델은 1,000회의 플레이아웃으로 최선의 수가 이기는지 확인하고, 다시 1,000회의 플레이아웃으로 다른 어떤 수도 이기지 못하는지 확인합니다.
- 두 가지 바둑판 크기를 이용할 수 있습니다: onlymove.net/9의 9×9와 onlymove.net/13의 13×13입니다. 모음집에는 220,000개가 넘는 고유한 문제가 있습니다(9×9에 약 107,000개, 13×13에 약 114,000개). 각 문제는 여덟 가지 방향 중 어느 쪽으로든 표시될 수 있습니다.
- 각 문제의 난이도는 실제 사람들이 실제로 문제를 푸는 방식에 가장 잘 맞추는 것을 학습 목표로 삼는 신경망이 설정합니다. 이 신경망은 플레이어들의 첫 시도 결과, 즉 실제 정답/오답 기록으로 학습되므로, 문제의 레이팅은 이론적인 어려움의 척도가 아니라 사람들이 실제로 그 문제를 통과하는 기력을 반영합니다. 입력값은 KataGo가 판을 읽어 낸 내부 표현(스킬 축에 쓰이는 것과 동일한 표현), 그리고 다양한 KataGo 구성이 그 문제를 얼마나 잘 푸는지입니다 — 여러 기력 설정의
b18c384nbt-humanv0와 여러 온도 설정의 kata1-b18c384nbt-s9996604416-d4316597426를 포함합니다. 이 입력값들로부터 신경망이 모든 문제의 레이팅을 예측합니다. 신경망은 데이터로부터 자체적인 난이도 척도, 쉬운 추측 하한선, 신뢰도 상한선을 학습하며, 하나의 신경망이 하나의 공유 척도 위에서 두 바둑판 크기를 모두 평가합니다.
- 문제의 레이팅은 그 문제를 50%가 아니라 약 80%의 확률로 푸는 플레이어의 기력입니다. 따라서 레이팅은 단지 반반의 확률로 맞힐 수준이 아니라, 안정적으로 통과하는 데 필요한 수준을 반영합니다.
- 레이팅을 급수/단으로 변환하기 위해, 플레이어들에게 이따금 자신이 플레이하는 서버에서의 기력을 물어봅니다. 이 신고는 레이팅-급수 곡선을 보정하고 여러분의 기력을 각 서버 고유의 척도에 대응시켜, 여러분이 보는 급수/단이 추상적인 숫자가 아니라 실제 세계의 기력에 대응하도록 합니다.
레이팅은 얼마나 정확한가요?
레이팅 모델은 다른 서버에서 플레이어들이 스스로 신고한 급수/단과 대조하여 검증됩니다. 또한 학습에 전혀 사용하지 않은 문제를 따로 떼어 검증하며, 이 검증은 여러 번의 독립적인 실행으로 반복됩니다 — 매번 무작위로 새로 뽑은 문제 10%를 제외하고 모델을 처음부터 다시 학습시킵니다. 이를 통해 암기가 아니라 처음 보는 국면에도 일반화되는지, 그리고 결과가 어느 한 번의 운 좋은 분할에 좌우되지 않는지 확인합니다.
- 급수/단 대 실제 세계의 급수/단. 각 플레이어의 모델 레이팅을 그들이 다른 서버에서 신고한 급수/단과 비교하면 스피어만 순위 상관계수가 약 0.83(±0.03)이며, 이는 약 220명의 플레이어의 약 420건의 신고에 걸쳐 나온 값입니다. 쉽게 말하면, 우리 레이팅으로 플레이어들을 정렬하면 실제 급수/단으로 정렬한 것과 거의 같은 순서가 나옵니다.
- 표시되는 급수/단이 얼마나 근접하는가. 각 플레이어에게 표시하는 서버 급수/단을 그들이 실제로 그곳에서 신고한 급수/단과 비교하면, 신고의 약 29%가 신고 값과 한 급수/단 이내이고 54%가 두 급수/단 이내에 들어갑니다(각각 ±3%포인트).
- 그것이 몇 판에 해당하는가. 급수/단으로 표현한 오차는 그 자체로는 가늠하기 어렵기 때문에, 같은 비교를 대국 수로도 환산합니다. 즉 일반적인 레이팅이 같은 정확도에 이르려면 몇 판이 필요한가입니다. 유럽 바둑 데이터베이스(EGD)가 공개한 통계에 기반하여, 유럽 급수/단을 알려준 플레이어들에서 측정하면, 우리가 표시하는 급수/단과 실제 급수/단의 일치도는 각각 약 12판(±2)의 대회 대국으로 만든 두 독립적인 레이팅이 서로 일치하는 정도와 비슷합니다. 단급자끼리의 한 판은 급수자끼리의 한 판보다 훨씬 많은 것을 결정하므로, 이 수치는 앞쪽 집단을 설명하는 것이지 모두에게 해당하지는 않습니다.
두 수치 모두 수백 건의 자기 신고를 바탕으로 하므로 각각 위에 표시된 표본 오차를 동반합니다. 재학습 간의 차이가 그 범위보다 작다면 실제 변화가 아니라 잡음입니다.
레이팅과 급수/단, 약점 축을 어떻게 만들고 앱이 그것들을 어떻게 사용하는지에 대한 전체 기술 설명은 방법론(영어)에 있습니다.
왜 이렇게 학습시키나요?
난이도를 실제 사람들의 결과에 맞추고, 약 80%의 성공률을 목표로 하며, 일정한 회상 확률에서 복습하도록 한 것은 임의적인 선택이 아닙니다. 각각은 학습 과학 문헌의 연구 결과에 근거를 두고 있습니다.
- 국면을 연구하는 것이 대국하는 것보다 기력을 더 키운다. 대규모 체스 플레이어 연구에서, 진지한 개인 학습 — 실제 대국에서 벗어나 결정 지점을 분석하는 것 — 에 쓴 시간이 참가한 토너먼트 대국 수보다 실력을 더 잘 예측했습니다(Charness, Tuffiash, Krampe, Reingold & Vasyukova, 2005). 국면이란 바로 그런 종류의 고립된 결정 지점으로, 모든 수가 진정한 수읽기 연습이 되도록 응축된 것입니다. 이것이 국면을 연습하는 것 자체의 근거이며, 나아가 단지 대국이 아니라 문제 풀이를 중심으로 전체 접근 방식이 구성된 근거입니다.
- 작은 바둑판은 전이가 알려진 두 가지 사이에 놓입니다. 사활 문제를 푸는 것과 대국하는 것은 각각 단독으로도 실제 기력으로 전이됩니다 — 대국은 결국 자기 자신으로의 전이이니까요. 9×9와 13×13 문제는 그 둘 사이의 스펙트럼에 놓이며 각각의 장점을 유지합니다: 전판 수읽기, 행마의 방향, 끝내기가 한 국면에 담긴 실전과 같은 폭과 다양성, 그리고 사활 문제와 같은 즉각적이고 명확한 피드백 — 정답은 한 수이고, 어느 수인지 바로 알게 됩니다.
- 새로운 문제에서 약 80% 성공을 목표로 하라. 학습은 훈련이 너무 쉽지도 너무 어렵지도 않을 때 가장 빠릅니다: 광범위한 학습 시스템 부류에서 최적점은 약 85%의 성공률 근처에 있습니다 — 그보다 훨씬 많이 실패하면 자료가 대부분 잡음이 되고, 훨씬 많이 성공하면 배울 것이 거의 남지 않습니다(Wilson, Shenhav, Straccia & Cohen, 2019). 정확히 그 최적점이 어디에 놓이는지는 과제가 얼마나 많은 잡음을 지니는지에 따라 달라지며, 전체 연습 일정을 최적화하는 분석들은 그 매개변수에 따라 달라지는 비슷한 목표치에 도달합니다(Ye, Su & Cao, 2022). 국면이 요구하는 잡음이 많은 일회성 수읽기의 경우 그 값은 85%보다 조금 아래를 가리키므로, onlymove는 약 80%를 목표로 합니다: 문제의 레이팅은 그 문제를 80% 확률로 통과하는 기력으로 정의되며, 문제 선택은 여러분을 그 수준 근처에 유지합니다.
- 일정한 회상 확률에서 복습하라. 가장 효과적인 분산 반복 일정은 고정된 달력이 아니라 그 항목을 여전히 기억할 확률이 일정한 목표치까지 감소했을 때 항목을 다시 가져옵니다 — 각 항목을 여러분 개인이 얼마나 빨리 잊는지에 비례해 복습시키는 것입니다(Tabibian, Upadhyay, De, Zarezade, Schölkopf & Gomez-Rodriguez, 2019). onlymove는 같은 원리를 같은 약 80% 수준에서 적용합니다: 틀린 문제는 여러분이 여전히 해법을 기억할 확률이 대략 80%라고 추정될 때 돌아오므로, 각 복습이 가장 큰 효과를 내는 순간에 이루어집니다.
랭킹 시스템
- 여러분의 급수/단은 최근 풀이 기록에 걸쳐 맞춘 여러분 기력의 최대우도 추정값입니다 — 대략 최근 수백 개의 첫 시도 문제이며, 가장 최근 것에 가장 큰 가중치를 두고, 매 문제 이후에 다시 계산됩니다. 기력을 뚜렷하게 구분해 주는 문제는 모호한 문제보다 급수/단을 더 많이 움직입니다.
- 기록이 적을 때는 빠르게 움직이고 근거가 더 쌓이면 안정됩니다. 새 계정은 20급에서 시작하므로, 그보다 강한 분은 거기서 대략 문제 하나당 한 급씩 올라가며, 추정이 여러분의 실제 기력에 가까워질수록 상승이 느려집니다.
- 첫 페이지의 급수/단은 그 최근 구간만 읽습니다. 통계 화면의 랭크 탭은 두 관점을 여러분의 전체 경력에 걸쳐 그립니다: 시간에 따른 첫 페이지 급수/단을 실선으로, 그리고 각 지점이 얼마나 정밀하게 알려져 있는지를 보여 주는 띠와 함께 부드럽게 처리한 장기 "안정 급수/단" 곡선으로 나타냅니다. 첫 페이지 급수/단은 여러분의 최근 컨디션을 반영하고 안정 곡선은 전체를 아우르므로, 둘은 다를 수 있으며, 특히 실시간 급수/단이 아직 따라잡는 중인 초기 적응 기간에 가장 두드러집니다.
- 높은 급수/단의 문제라도 맞게 추측할 수는 있지만, 급수/단을 유지할 만큼 자주(5분의 4) 맞히지는 못합니다.
- 학습을 돕기 위해, 틀린 문제는 시스템이 여러분이 해법을 기억할 확률이 80%라고 판단할 때 나중에 다시 표시됩니다.
- 링크로 받은, 여러분 자신의 진행 과정의 일부가 아닌 문제를 푸는 것은 여러분의 급수/단에 영향을 주지 않습니다.
기능
- 브라우저에서 독립 실행형 앱으로 설치할 수 있습니다.
- 여러 기기에서 같은 계정에 로그인할 수 있으며, 풀이 기록과 급수/단이 어디서나 동기화됩니다.
- 복습 모드에는
kata1-b18c384nbt-s9996604416-d4316597426이 최소 30회, 보통 수백 회의 플레이아웃으로 미리 평가한 수많은 국면이 있습니다.
- 미리 평가되지 않은 국면은 서버가
kata1-b18c384nbt-s9996604416-d4316597426로 30회의 플레이아웃으로 분석합니다. 부하가 높을 때만 1회의 플레이아웃으로 낮아지며, 그럴 때는 그 사실을 알려 줍니다.
- 실패했을 때, 너무 빨리 두었고 더 오래 생각하면 더 나은 결과가 나오는 경우, 천천히 붉어지는 화면이 나타납니다.
- 실패했을 때, 복습에 시간을 많이 들이지 않은 반복 문제를 틀렸고 해법 복습에 시간을 더 들이면 더 나은 결과가 나오는 경우, 천천히 붉어지는 화면이 나타납니다.
- 문제 선택은 여러분의 시도 기록으로부터 학습합니다. 모든 국면은 소수의 스킬 축 — 현재 일곱 개로, 사활, 끝내기, 패, 포석, 손빼기, 선수, 수상전을 다룹니다 — 위에서 점수가 매겨집니다. 이 축들은 KataGo가 판을 읽어 낸 내부 표현을 바탕으로 실제 플레이어들의 풀이 결과로부터 학습되어, 각 축은 플레이어들 사이에 실제로 존재하는 차이를 포착합니다. 앞으로 나올 문제는 여러분이 자주 걸려 넘어지는 스킬 쪽으로 기울어집니다. 여러분이 틀린 수를 두면, 실제로 둔 수도 같은 축 위에서 점수가 매겨지므로, 시스템은 "국면이 읽기 어렵다"와 "여러분이 이런 종류의 수를 과하게 두거나 부족하게 둔다"를 구분할 수 있습니다 — 그리고 문제 선택은 그 방향을 이용해, 이미 과하게 두는 것을 더 내놓기보다 부족하게 두는 스킬을 우선합니다.
- 틀린 문제가 복습할 때가 되면 알려 주도록 푸시 알림을 켤 수 있습니다.
- 커뮤니티 탭은 지난 한 주 동안의 서버 전체 익명 통계 — 전체 활동, 급수/단 분포, 시간 사용, 그리고 플레이어들이 틀린 문제로 얼마나 빨리 돌아오는지 — 를 여러분 자신의 위치를 강조하여 보여 줍니다.
- 주간 리더보드는 지난 7일 동안 활동한 모든 플레이어를 예측 급수/단 순으로 보여 주며, 원하는 바둑 서버의 단위로 표시할 수 있습니다. 항목은 국기만 표시되는 익명이지만, 플레이어가 실제(예: EGF) 프로필과 자신을 연결하면 예측 옆에 신고된 급수/단도 함께 표시됩니다.
- 통계 페이지는 여러분의 문제 풀이 확률에 영향을 미치는 요인들을 추적합니다. 이상적으로는 시간 관련 지표가 0에 가까워야 하며, "풀이한 문제당" 지표의 양의 추세는 학습을 나타냅니다. 또한 시도별 레이팅 기록 차트, 95% 신뢰 구간이 있는 부드럽게 처리한 장기 기력 추정값, 세션 간 컨디션 분산 지표, 그리고 여러분이 잘못 두는 경향이 있는 스킬을 평이한 문장으로 설명한 정렬된 목록을 보여 줍니다.
- 여러 바둑 서버에서 여러분의 추정 급수/단 — 각 서버 고유의 척도에서 여러분의 기력이 어떻게 읽힐지 — 을 랭크 탭의 서버 선택기에서 또는 첫 페이지의 급수/단을 눌러 볼 수 있습니다. 여러분의 첫 페이지(onlymove) 급수/단은 풀이 속도에 대해 조정되지 않지만, 각 서버의 급수/단은 조정됩니다: 여기서는 시간을 더 들이면 문제를 풀 가능성이 실제로 높아지므로 여러분의 첫 페이지 급수/단은 그것을 인정합니다; 하지만 실제 대국에서는 느린 제한 시간이 여러분이 이길 가능성을 높여 주지 않습니다 — 상대도 똑같이 추가 시간을 얻고 그만큼 강해지기 때문입니다 — 그래서 오래 생각하는 데 기대는 플레이어는 시간 제한이 있는 서버에서 조금 약하게 읽힙니다.
- 접근성: 물리 키보드만으로 착수할 수 있습니다 — 앱 어디서든 바둑판 좌표(예:
C3)를 입력하고 Enter 키를 누르면 그 자리에 착수됩니다(열 문자는 I를 건너뛰고, 행 번호는 아래에서 위로 셉니다; 풀이 중에도 복습 중에도 사용할 수 있습니다). 바둑판 가장자리에는 아주 작은 좌표 라벨이 표시되며, 모든 컨트롤은 키보드로 조작할 수 있습니다. 정밀한 터치나 마우스 조작이 어려운 플레이어를 위해 설계되었습니다.
변경 이력
업데이트의 전체 이력은 전체 변경 이력을 참고하세요.