計算方法 牌譜 2018-19〜2026-27

計算方法の詳しい解説(日文)

このページは、本サイトが表示している「実力推定」「運の指標」「トップ確率」「順位確率」などが、どういう計算から出てきた数字なのかを、用語集の短い説明より一段深く説明するものです。

数式が出てきますが、四則演算の範囲で読めるように書いています。また、それぞれの計算が何を単純化しているか(=どこまで信用してよいか)も隠さず書きます。数字を見るときに気をつけてほしい点は、太字の段落と「※」の注記にまとめています。

1. データの出所と集計の範囲

元になっているのは、有志の方が公開しているM リーグ牌譜です。全局の配牌・ツモ・打牌・鳴き・和了が記録された牌譜で、2018-19から現在まで1,940半荘・23,653局を、試合の翌朝に自動で取り込み直しています。

試合のポイントは、牌譜の点数からMリーグのルールどおりに計算しています。

  • 25,000点持ち30,000点返し。順位点は+30/+10/−10/−30で、トップにオカ+20。
  • 同点は公式記録と同じく同着(2人とも上の順位)とし、順位点を分け合います。0.1ptで割り切れない端数は起家に近い人へ。
  • 終局時に残った供託はトップが受け取る。
  • トビなし、西入なし、途中流局なし。南4局の親は和了や聴牌で連荘を続ける(アガリやめなし)。

今季の公式成績と照合し、ポイント・局数・副露率・リーチ率・和了率・放銃率が一致することを確認しています。

※ 公式サイトは率を小数第2位で切り捨てて表示しているため、本サイトの値と見た目が0.01ずれることがあります。

牌譜の中には、ドラ表示牌やツモの記録が欠けている・持っていない牌を捨てているなど、書き起こしの不備がある局がわずかにあります(23局)。こうした局は、局単位で打ち方と運の指標から除いています。

※ 不備のある局でも、点数の記録が正しい限り、試合結果(ポイント)には含めています。

2. 「実力推定」は平均に引き戻した値

麻雀の成績は実力と運の両方で決まります。少ない試合数で好成績の選手は、実力が高いのかもしれないし、たまたまツイていただけかもしれません。「実力推定」は、この二つを見分けるために、実績をリーグ平均の方へ引き戻して見積もった値です。

直感的には、シーズン序盤の打率ランキングと同じです。開幕10打席で打率5割の打者を「5割打者」とは誰も思いません。試合数が少ないうちは大きく引き戻し、試合数が増えるほど実績に近づけます。

2.1 半分安定する件数 k

どれだけ引き戻すかは、指標ごとの「半分安定する件数」kで決まります。k件のデータがそろうと、実績の半分が実力(または打ち方の個性)、半分が運で説明できる、という件数です。求め方は次のとおりです。

  1. 選手ごとのシーズン成績のばらつきを計算する(全体のばらつき)。
  2. 試合数から、運だけで生じるばらつきを計算する(試合数が4倍になると半分になる)。
  3. 全体のばらつきから運の分を差し引き、残りを「本当の実力の差」とする。
  4. k = 運のばらつき(1件あたり) ÷ 本当の実力の差を計算する。

2018-19以降のレギュラーシーズンで、1シーズン10半荘以上出場した、のべ256人分のデータを使っています。

指標k(半荘換算)90%区間1シーズンでの実績の重み
副露率約5半荘約4半荘〜約9半荘83%
立直率約46半荘約30半荘〜約103半荘35%
和了率約88半荘約54半荘〜約257半荘22%
放銃率約86半荘約50半荘〜約301半荘23%
1半荘あたりポイント約408半荘約143半荘〜上限なし6%
平均着順約489半荘約121半荘〜上限なし5%

2.2 推定値の計算

実力推定は、実績とリーグ平均を、試合数nとkの比で混ぜた値です。

推定値 = (n × 実績 + k × リーグ平均) ÷ (n + k)

具体的には、佐々木寿人選手は通算304半荘で1半荘あたり+3.4ptです。ポイントのkは約408半荘、リーグ平均は0なので、(304 × 3.4 + 408 × 0) ÷ (304 + 408) ≈ +1.4が実力推定になります。「実績の重み」はn ÷ (n + k)で、この例では43%です。推定に本人の実績をどれだけ使ったかの割合で、その選手が強い確率ではありません。

「× 0」は何をしているのか

0を掛けているので意味のない計算に見えますが、この式は、佐々木寿人選手の実際の304半荘に、リーグ平均どおりに打った架空の408半荘を付け足して、合わせた712半荘の平均を取り直す計算です。Mリーグのポイントは1試合の4人の合計がいつも0なので、リーグ平均も1半荘あたり0pt。架空の408半荘の合計が408 × 0 = 0になる、というのがこの部分です。

和了率のように平均が0でない指標では、この部分は0になりません。どの指標も同じ形の式で計算しているので、ここでも省かずに書いています。試合数が少ない選手ほど架空の半荘の比重が大きくなり、推定は平均(0)に近づきます。実績の重み43%は、混ぜた712半荘のうち本人の実際の成績が占める割合です。

1シーズンだけだと引き戻しはさらに強くなります。2025-26に1半荘あたり+16.2ptだった下石戟選手(38半荘)でも、実力推定は+1.4ptです。

実力推定が平均に近いことは、「この選手は平均的な選手だ」という評価ではありません。「これまでのデータからは、平均との差を運と区別できるほどの証拠がない」という意味です。試合数が増えれば、推定値は実績に近づいていきます。

2.3 推定の幅と「上限なし」

k自体も推定値です。選手をくじ引きのように選び直して同じ計算をする方法(ブートストラップ)を300回行い、90%区間を出しています。

着順やポイントでは、kの区間の上限が定まりません。これは、今のデータでは「プロ同士の成績の差はすべて運」という可能性すら否定できない、という意味です。一方、副露率や立直率など打ち方の指標は区間が狭く、選手ごとの違いがはっきりしています。

2.4 各選手の90%区間

推定値の横にある90%区間は、選手全体で見て9割以上の選手の本当の値がその範囲に入るように作った幅です。推定値は平均に引き戻しているので、本当の値が平均から遠い選手ほど、推定値は本当の値より平均寄りにずれます。区間はこのずれの分も見込んで、通常の「推定値 ± 1.645 × 標準誤差」より少し広く取っています(Armstrong, Kolesár, Plagborg-Møller, 2022)。

この方法は、選手の実力の分布を正規分布と決めつけずに、選手全体で平均9割が区間に入るように作られています(論文の前提のもとで)。特定の1人について「9割の確率でこの範囲にある」という意味ではありません。引き戻しが強い指標(着順・ポイント)ほど区間は広めになり、引き戻しがほとんどない指標(副露率など)では通常の区間とほぼ同じです。

95%ではなく90%にしているのは、読みやすさとのバランスです。95%は広く使われている慣習で、特別な根拠のある数字ではありません。麻雀の成績は1試合ごとの揺れが大きく、95%にすると区間がさらに広がって、ほとんどの選手の区間が重なり、違いが読み取れなくなります。そこで、1割は外れることを受け入れて区間を狭めています。90%はサイトを作った最初から、すべての指標・選手・検証で同じにしていて、結果を見てから選び直したものではありません。その分、90%区間が平均(0)をまたがなくても、95%区間ならまたぐことがあります。区間の端が0に近い選手は、平均との差がはっきりしているとまでは言えない点に注意してください。

※ 区間が正しく働くことは、答えを決めた架空のシーズンで確かめています(この計算は正しいの?)。

2.5 「1シーズンの成績差の94%が運」の意味

トップページの数字は、1シーズンの「1半荘あたりポイント」が選手ごとにばらつく、そのばらつきのうち、運だけで生じる分の割合です。「1半荘の結果の94%が運」「どの選手も94%は運」という意味ではありません。選手どうしの成績の差が、どこから来ているかの割合です。

計算のしかた(2018-19〜2025-26のレギュラーシーズン、1シーズン10半荘以上ののべ256人)

  1. 1半荘のポイントは、同じ選手でも標準偏差で約45ptばらつく(トップなら+50pt前後、ラスなら−50pt前後)。
  2. 1シーズン約25半荘の平均にすると、運だけで生じるばらつきは45 ÷ √25 ≈ 9.2pt。全員がまったく同じ実力でも、シーズン成績はこれだけ散らばる。
  3. 実際の選手ごとのシーズン成績(1半荘あたり)のばらつきは 9.5pt。
  4. ばらつきは二乗(分散)にすると足し引きできるので、9.2² ÷ 9.5² ≈ 94%が運、残りが実力の差。

つまり、実際の成績表のばらつき(9.5pt)は、運だけで説明できるばらつき(9.2pt)とほとんど同じ大きさです。実力の差として残るのは、標準偏差で1半荘あたり約2.2pt。1シーズン25半荘の通算にすると、実力による差は±56pt程度、運による差は±231pt程度です。

※ 2.1のkで計算しても同じ数字になります。1シーズン25半荘の実績の重みは25 ÷ (25 + 408) ≈ 6%で、残りの94%が運です。

確かめ:試合結果を選手の間でシャッフルする

計算の前提に頼らない確かめ方もあります。同じシーズンの試合結果(1半荘ごとのポイント)を、選手の間でくじ引きのように配り直します。こうすると選手と成績のつながりが完全に切れるので、「全員が同じ実力だった世界」のシーズンができます。これを1,000回くり返しました。

  • シャッフルしたシーズンのばらつき:平均9.1pt(9割は8.5〜9.8ptの範囲)
  • 実際のシーズンのばらつき:9.5pt

実際の成績表は、シャッフルした「全員同じ実力」の成績表の範囲に収まっています(シャッフルの20%が、実際以上にばらつきました)。 1シーズンの成績表だけを見ても、実力差のある世界なのか、全員が同じ実力でくじを引いた世界なのか、ほとんど見分けがつかない、ということです。

「少なくとも85%」の意味

実力の差の大きさ(上の2.2pt)自体も推定値で、幅があります。2.3のブートストラップで、実力差がいちばん大きく見積もられる側(kの90%区間の下限、約143半荘)を取っても、運の割合は85%です。逆に、実力差が0(すべて運)という可能性は、今のデータでは否定できません。

※ 長い期間では実力の割合が増えます。通算304半荘まで積み重ねると、実力で説明できる割合は約43%になります。平均着順でも同じ計算で、1シーズンの差の約95%が運です。

3. パーセンタイルと打ち方のタグ

パーセンタイルは、同じシーズンで規定の試合数(シーズンは10半荘、通算は40半荘)以上に出場した選手の中での位置です。実績ではなく推定値で並べているので、少ない試合数の偶然で上位に来ることはありません。

バーの色は、良し悪しのある指標(和了率や放銃率など)だけに付けています。赤が良い側、青が悪い側です。立直率や副露率のように「多いほど良い」とは言えない指標は、打ち方の違いを表すものとして灰色にしています。

打ち方のタグ(「鳴き多め」「リーチ多め」など)は、通算の推定値が上位または下位25%に入り、しかもその指標の実績の重みが50%以上の場合だけ付けています。データが少なくて偶然かもしれない特徴には、タグを付けません。

選手ページ冒頭の文章も同じ考え方で作っています。副露率と立直率の組み合わせで打ち方のタイプを書き、ほかの打ち方の指標のうち上位または下位15%に入り実績の重みが50%以上のものを、極端な順に最大3つ挙げています。最後の一文は、実力推定の90%区間が0をまたぐかどうか(運の幅を考えても平均と差があるか)で書き分けています。

選手ページの最後の「打ち方が似ている選手」は、打ち方の12の指標の通算の推定値を、選手の間のばらつきで割ってそろえ、全体として近い順に3人を選んでいます。このとき、データで確かに言える指標(副露率や牌効率一致率など、実績の重みが大きいもの)ほど重く扱っています。重み付けの方法は、出場シーズンを奇数年と偶数年に分けて似ている選手を出し直したとき、答えが最もよく一致するものを選びました。最も近い選手でもほかの選手より離れている場合(全選手の上位25%に入るほど遠い場合)は、「独自のスタイル」と表示します。

※ パーセンタイルは選手同士の比較で、「100」でも完璧という意味ではありません。規定の試合数に届かない選手には表示しません。

3.1 牌効率一致率

自由に手を組める場面の打牌で、「次に手が進む牌の残り枚数(受け入れ枚数)」が最も多くなる牌を切った割合です。対象は、自分も他家もリーチしていない、自分の12巡目までの打牌で、切った後にテンパイまであと1〜2枚の手(1向聴・2向聴)に限ります。受け入れ枚数は、自分から見えていない牌(山と他家の手牌)だけを数えます。

受け入れ最大の牌を切らなかった打牌は、理由で分けて数えています。受け入れ最大の牌がすべてドラ・赤5・役牌の対子のどれかで、それを残した場合は「打点のための崩し」、向聴数を戻した場合は「後退」、それ以外は「受け入れの少ない選択」です。リーグ全体では約73%の打牌が受け入れ最大と一致します。

この指標は灰色(良し悪しなし)にしています。選手ごとの差は安定していて(前半と後半の相関0.46、翌シーズンとの相関0.52)、打ち方の個性としては確かに表れます。一方で、一致率が高い選手ほど和了率・副露率・放銃率が高く、和了打点は低い傾向があり、運を除いたポイントとの関係は見られませんでした(相関0.12、統計的に有意でない)。受け入れ枚数は「速さ」だけを測る物差しで、打点や守備、読みの価値は入っていないためです。一致率が高いのは「速度を重視した手組み」、低いのは「形や打点を重視した手組み」と読むのが適切です。天鳳の研究でも、AIと違う選択をした割合は卓のレベルが上がるほど下がる一方、最上位の鳳凰卓の中では成績との関係は弱かったと報告されています(大神ほか, 2023)。

※ 2026年9月時点の全打牌(約50万打牌)での検証です。副露した手も含み、副露後は七対子・国士無双を数えません。

3.2 聴牌巡目(運の補正後)・即リーチ率・ダマ率

鳴かずに12巡目(自分の12打目)までに聴牌した局を対象に、聴牌までの早さと、聴牌した後の選択を見ています。

聴牌巡目(運の補正後)は、配牌とツモの運をそろえたうえでの聴牌の早さです。リーグ全体の局から、「配牌の向聴数」と「聴牌までのツモの良し悪し(手が進んだツモの数と、その期待値の差)」で聴牌巡目を予測する式を作り、平均的な選手ならその配牌とツモで何巡目に聴牌したかを出します。実際の聴牌がそれより何巡早かったかを求め、リーグ平均の聴牌巡目から差し引いて「平均的な配牌とツモだったら何巡目に聴牌したか」に直した値が、この指標です。小さいほど早い聴牌です。局ごとのばらつきが大きく、選手の特徴が表れるまでに800局前後の聴牌が必要なので、多くの選手で推定値は平均寄りになります。

即リーチ率は聴牌した打牌でそのままリーチした割合、ダマ率はその局で最後までリーチしなかった割合です(聴牌した後に待ちを変えてからリーチした局は、どちらにも入りません)。即リーチ率はリーグ全体で年々上がっていて(2018-19シーズンの約67%から2026-27シーズンの約78%)、ダマ率は約23%から約17%に下がっています。そのため、各局の値を「そのシーズンのリーグ平均との差」に直してから集計しています。出場した時期が違う選手同士でも、同じ時代の中でどれだけ即リーチが多いかで比べられます。

どれも灰色(良し悪しなし)で表示しています。即リーチが多い選手ほど成績が良い傾向も見えますが、はっきりした関係とは言えないためです。

4. 運の指標

運の指標は、どれも「選手の判断では変えられないもの」を、期待値との差で測っています。プラスは平均より恵まれていたことを表します。

指標測り方
配牌の良さ配牌の向聴数が、リーグ平均よりどれだけ少ないか
配牌のドラ・赤配牌に入っていたドラと赤ドラの枚数の、リーグ平均との差
ツモの良さツモで手が進んだ回数と、そのときの手牌から計算した「手が進む確率」との差
裏ドラ運リーチで和了したときの裏ドラの枚数と、見えていない牌から計算した期待値との差
一発率リーチ1回あたりの一発の率の、リーグ平均との差。どんな形でリーチするかは選手の判断なので、4つの中では打ち方の影響が残りやすい指標です

4.1 ツモの良さは「その手牌から見た確率」と比べる

ツモの良さは、運の中でも成績への影響がいちばん大きい部分です。ただし、測り方を間違えると実力が混ざります。たとえば「同じ向聴数なら、手が進む確率はみな同じ」とみなすと、受け入れの広い形を残す牌効率の上手な選手ほど「ツモが良かった」ことになってしまいます。

そこで、ツモのたびに次の計算をしています。

  1. その選手が実際に残していた手牌について、引けば向聴数が下がる牌の種類を調べる。
  2. その牌が、その選手から見えていない牌(山と他家の手牌)の中に何枚残っているかを数える。
  3. 手が進む確率 = 有効牌の残り枚数 ÷ 見えていない牌の枚数とする。
  4. 実際に手が進んだかどうか(1か0)から、この確率を引く。

ポイントは、確率を「選手が残した手牌」から計算していることです。牌効率の良さは確率の側に入るので、差し引いた残りは、どんな打ち方をしていても平均0になり、打ち方の影響をできるだけ除いた運と見なせます。

※ 他家は使いやすい牌を抱えていることが多く、単純に数えた確率は実際より少し高めに出ます。そのため、向聴数ごとに実際の頻度と合うよう比率で補正しています。

5. 運を除いたポイント

運の指標がわかれば、その分を成績から差し引くことができます。手順は次のとおりです。

  1. 局ごとに、自分と相手3人それぞれの運の指標を並べる。ツモの運は、引く前の向聴数(聴牌・1向聴・2向聴・3向聴以上)ごとに分けて数える。
  2. その局で動いた「期待ポイント」(6章)を、運の指標から予測する式を作る。
  3. 予測された分を「運による獲得ポイント」とし、実際のポイントから差し引く。

運の指標はどれも平均0になるように作ってあるので、差し引いても平均的な評価は変わらず、ばらつきだけが減ります。マラソンで、追い風を受けた区間のタイムを少し足し、向かい風の区間を少し引いて比べるのと同じです。風の補正は平均すると0なので、誰かを一方的に有利にも不利にもせず、「たまたま風に恵まれた」分だけを取り除きます。

ツモの運を向聴数ごとに分けるのは、同じ「手が進むツモ」でも価値が大きく違うからです。聴牌からの1枚は和了そのものですが、3向聴からの1枚は、和了までの長い道のりの一歩にすぎません。予測の式が見積もった1枚あたりの価値も、聴牌からのツモが最も大きく、向聴数が多いほど小さくなりました。まとめて1つの値で数えていたころは、ばらつきの減り方が約20%でした。

この補正で1半荘ごとのポイントのばらつき(分散)は34%小さくなり、半分安定する試合数は約408半荘から約270半荘に縮みます。

※ 予測の式は、あるシーズンの補正にそのシーズン自身の結果を使わないよう、シーズンごとに他のシーズンのデータだけで作っています。

※ 同じ考え方はポーカーのAIの評価(AIVAT)や、東京大学による麻雀の研究(MJ-DLVAT)でも使われています。これらは局面の価値をニューラルネットワークで評価してより多くの運を取り除いていますが、本サイトでは牌譜から直接数えられる運に限っています。

6. トップ確率とポイントの内訳

6.1 トップ確率

試合ページのトップ確率は、各局の開始時点から、試合の残りを何度もシミュレーションして求めています。

  1. 過去の実際の局の結果を1つ無作為に選ぶ(親から見た4人の点数の増減と、親が連荘したかどうか)。
  2. その結果を、いまの親の位置に合わせて当てはめ、点数と供託を進める。
  3. 南4局で親が連荘しなければ試合終了。そうでなければ1に戻る。
  4. 試合の最後の点数からMリーグのルールでポイントと着順を出す。
  5. これを2,000回繰り返し、トップで終わった割合を確率とする。

オーラスは他の局と戦い方が違うので、オーラスの結果はオーラスの局から選びます。また、あるシーズンの確率には、そのシーズン以外の局の結果だけを使っています。答えを知っているデータで予測する、という反則を避けるためです。

精度の確認として、予測したトップ確率と実際の結果を比べています。全員を25%と予測した場合と比べて予測誤差(ブライアスコア)は29%小さく、予測した確率と実際にトップになった割合もほぼ一致しています。一致の度合いはこの計算は正しいの?で詳しく確かめています。

※ 2,000回の繰り返しによる標準誤差は、最大でも±1.1ポイント程度です。

6.2 ポイントの内訳(期待ポイントの変化)

同じシミュレーションで、各局の開始時点での「最終ポイントの期待値」も出しています。ある局の前後で期待値がどれだけ動いたかが、その局がその選手にもたらした価値です。

局ごとの変化をすべて足すと、試合の最終ポイントとぴったり一致します(開始時点の期待値との差として)。

選手ページの「ポイントの内訳」は、この変化を局の結果ごと(自分の和了・放銃・他家のツモ・他家同士の出和了り・流局)に集計したものです。試合ページの「この試合を決めた一局」は、誰かの期待ポイントを最も大きく動かした局です。

7. 局収支の内訳

局収支は、1局あたりの点数の増減を、何によって増えたか・減ったかに分けたものです。分類はとつげき東北・伊藤毅志(2009)の分析にならい、和了を「リーチ」「副露」「ダマ」、放銃を相手の手の種類(リーチ・副露・ダマ)で分け、他家のツモとその他(流局など)を加えています。

各項目を足すと、その選手の1局あたりの平均収支になります。リーグ全体では、1局あたりリーチでの和了が+924点、他家のツモが-757点です。選手ページではこのリーグ平均との差を並べているので、どこで稼ぎ、どこで失っているかが比べられます。

※ 局収支は点数(素点)の増減で、順位点は含みません。ポイントとの関係は6.2の「ポイントの内訳」で見られます。

8. 順位確率と進出確率のシミュレーション

シーズンの残りには無数の展開があります。それを一つずつ数え上げる代わりに、ありうる展開を20,000回くじ引きのように作り、その中で各チームが何位になったか、セミファイナル・ファイナルに進んだか、優勝したかを数えます。手順は次のとおりです。

  1. レギュラーシーズンの残り試合を、公表されている日程どおりの4チームで組む(セミファイナルとファイナルは、進出チームが決まるまで日程がないため無作為に組む)。
  2. 1試合ごとに、過去のMリーグの試合結果(1位〜4位のポイント)を1つ無作為に選び、4チームに割り当てる。
  3. チームの実力に応じて、4チームのポイントをわずかにずらす:ポイント + s − (4チームの s の平均)。sはそのチームの選手の、運を除いたポイントの実力推定(通算)の平均です。4チームの合計は0のままです。
  4. レギュラーシーズンが終わったら、上位チームがポイントの半分を持ってセミファイナルへ進み、同じ手順で試合を続ける。
  5. セミファイナル、ファイナルも同じように行い、最終順位と優勝チームを記録する。

今季の方式は、レギュラーシーズンが各チーム120試合で上位6チームがセミファイナルへ、セミファイナルが各チーム20試合で上位4チームがファイナルへ進みます。ポイントの持ち越しが「半分」であることは、前シーズンの公式記録で確認しています。

チームの実力差は、ポイントにはわずかな差しか生みません。実力は所属選手の「運を除いたポイント」の実力推定の平均で、1試合あたり数pt程度です。2章で見たとおり、1シーズンの成績は大部分が運で決まるためです。シーズン序盤に全チームの確率がほぼ横並びになるのは、この計算の結果として自然なことです。

※ 1試合の結果は相手チームと無関係に選ぶので、組み合わせが効くのは、上のチームの実力による補正の部分だけです。実際の日程と無作為な組み合わせで計算を比べると、どのチームの確率も差は1ポイント以内(計算の乱数による揺れと同じ程度)でした。

※ 20,000回の繰り返しによる標準誤差は、最大でも±0.4ポイント程度です。表示が「0%」でも「起こりえない」ではなく、「シミュレーションの中で一度も起きなかった」という意味です。

9. 最終順位の表と確率の推移

「レギュラーシーズンの最終順位」の表は、8章のシミュレーションで各チームが1位〜10位のどこで終わったかを数えたものです。各チームの行を横に足すと100%、各順位の列を縦に足しても100%になります。太線より左がセミファイナル進出圏です。色の濃さは表の中で最も高い確率を基準にしているので、シーズン序盤の確率が横並びの時期でも、どこに山があるかが見えます。塗りつぶしたマスは、各チームで最も確率の高い順位です。

※ シミュレーションの中でポイントがちょうど同じになった場合は、プログラム内部のチームの並び順で順位を決めています。0.1pt単位のポイントが完全に一致することはごくまれで、確率への影響はほとんどありません。

「セミファイナル進出確率の推移」は、各試合日の終了時点の確率です。過去の時点の確率は、その日までの結果だけを使って計算し直したもので、その日に実際にサイトに表示されていた値とは限りません。

※ 過去の時点の計算は5,000回の繰り返しで行っているため、標準誤差は最大±0.7ポイント程度です。

10. この計算は正しく働いているか

計算の手順が理屈の上で正しくても、プログラムの誤りや前提の崩れがあれば、数字は信用できません。そこで、統計学の論文で使われている方法で、4つの点を確かめています。合格の基準は結果を見る前に決め、不合格だったものもそのまま載せています。対象は2018-19〜2025-26の完了したシーズンです。

確かめたこと方法結果
実力推定と90%区間正解が分かっている模擬シーズンで計算し直す✓ 合格
実力推定の予測力シーズン前半から後半を予測する✓ 合格
運の指標に実力が混ざっていないか並べ替え検定✓ 合格
トップ確率・ラス確率の当たり具合信頼性曲線(CORP)と較正の検定△ 一部不合格

それぞれの確かめ方と結果、見つかった弱点とその直し方は、この計算は正しいの?のページで、できるだけやさしく説明しています。

11. この計算の限界と単純化

単純化内容と影響
実力はシーズン中一定調子の波・成長・体調は考えていません。好不調が本当にあるなら、その分は「運」に含まれます。
選手の実力差の大きさ着順・ポイントのkは幅が大きく、上限が定まりません。推定値の引き戻しの強さも、その分だけ不確かです。各選手の90%区間は、実力差が小さい場合には広めに出ます(検証)。
測れる運は一部だけ配牌・ツモ・裏ドラ・一発以外の運(相手の待ちに当たったか、相手のツモが早かったか、など)は差し引いていません。
ツモの良さの補正他家の手牌の偏りを、向聴数ごとの比率でまとめて補正しています。局面ごとの細かな偏りは残ります。
トップ確率の局の結果オーラス以外は、点数状況によって戦い方が変わることを考えていません(大きくリードしたトップ目が守りに入る、など)。本場・供託による点数の違いもおおまかです。
順位確率のもとになるデータの少なさシーズン序盤は消化試合が少なく、チームの実力差も運に比べて小さくしか推定できないため、確率はほぼ横並びになります。表示の誤差はシミュレーション回数によるぶれだけで、実力の見積もりの誤差は含みません。過去のシーズンで当たっていたかも、優勝が1シーズン1回しかないため確かめられていません。
チームの実力所属選手の平均で、誰が何試合に出るかは考えていません。新加入の選手はリーグ平均として扱います。
対戦の組み合わせレギュラーシーズンは公表された日程を使っています。延期などで日程と実際の試合が合わなくなったときは、合わせ直すまで無作為な組み合わせで計算します。セミファイナル以降は無作為です。
牌譜の不備書き起こしに不備のある23局は除いています(全体の0.1%)。牌譜そのものに情報が欠けている局で、打ち方と運の指標に反映されません(試合結果には含みます)。
対象の範囲Mリーグの試合だけで推定しているため、選手の他の対局の実績は含みません。

コラム:なぜ推定値はこんなに平均に寄るのか

選手ページを見ると、実績で大きくプラスの選手も、実力推定では0に近い値になっています。「計算が慎重すぎるのでは?」と思われるかもしれません。理由は3つあります。

  1. 1シーズンの試合数では、運のばらつきが実力差よりずっと大きい。サイコロを25回振った平均を比べれば、全員が同じサイコロでも3.1の人もいれば3.9の人もいます。Mリーグの1シーズンは1人あたり約25半荘で、ポイント差のうち運で説明できる割合は推定94%です。
  2. トップクラス同士の対戦なので、実力差そのものが小さい。平均着順の本当の実力差は、標準偏差で0.051着ほどしかありません。
  3. 平均に寄せた方が、将来の成績をよく当てる。過去のシーズンで、前シーズンの成績から次シーズンの成績を予測して比べると、実績をそのまま使った場合の予測誤差は、平均に寄せた推定値の約2倍でした。

正直な例外

この引き戻しが外れやすい場合もあります。本当に実力が変わった選手(大きく成長した・調子を崩した)や、Mリーグでの試合数が少ない新加入の選手では、過去のデータに頼る推定は現在の実力とずれることがあります。また、推定の土台になるk自体の幅が大きいことは、2.3で書いたとおりです。推定値は「これまでのデータから言えること」であり、選手の評価や予想そのものではない、と受け取ってください。

詳しい分析はコラム「Mリーグの着順はどれだけ運で決まるのか?」にまとめています。

参考文献

  • Ogami, Amano, Tsuruoka. "MJ-DLVAT: A Deep Learning Value Assessment Technique for Mahjong." IEEE, 2024.
  • 大神卓也・天野克敏・奈良亮耶・鶴岡慶雅「分散減少法を用いた麻雀における実力推定」ゲームプログラミングワークショップ2023論文集, pp.76–82, 2023.
  • Burch, Schmid, Moravčík, Bowling. "AIVAT: A New Variance Reduction Technique for Agent Evaluation in Imperfect Information Games." AAAI, 2018.
  • Duersch, Lambrecht, Oechssler. "Measuring skill and chance in games." European Economic Review 127, 2020.
  • とつげき東北・伊藤毅志「牌譜の解析による麻雀の分析」人工知能学会誌 24(3), 2009.
  • Li et al. "Suphx: Mastering Mahjong with Deep Reinforcement Learning." arXiv:2003.13590, 2020.
  • Talts, Betancourt, Simpson, Vehtari, Gelman. "Validating Bayesian Inference Algorithms with Simulation-Based Calibration." arXiv:1804.06788, 2018.
  • Brown. "In-season prediction of batting averages: A field test of empirical Bayes and Bayes methodologies." Annals of Applied Statistics 2(1), 2008.
  • Dimitriadis, Gneiting, Jordan. "Stable reliability diagrams for probabilistic classifiers." PNAS 118(8), 2021.
  • Brill, Yurko, Wyner. "Exploring the difficulty of estimating win probability: a simulation study." Journal of Quantitative Analysis in Sports 22(1), 105–115, 2026. doi:10.1515/jqas-2024-0130(arXiv:2406.16171, 2024)
  • Armstrong, Kolesár, Plagborg-Møller. "Robust Empirical Bayes Confidence Intervals." Econometrica 90(6), 2022.
  • Phipson, Smyth. "Permutation P-values Should Never Be Zero." Statistical Applications in Genetics and Molecular Biology 9(1), 2010.

本ページの内容は統計的な推定とシミュレーションの解説であり、計算結果はMリーグ機構の公式発表ではありません。数値は試合翌朝の自動更新で最新のデータに置き換わります。