Most differences in results are within chance.They are no grounds for criticising players.

検証 4つのテスト

この計算は正しいの? (Japanese)

このサイトは「実力推定」「運の指標」「トップ確率」などの数字を出しています。でも、計算の手順がもっともらしく見えても、プログラムの誤りや思い込みがあれば、数字は信用できません。このページでは、それらの数字が本当に正しく働いているかを確かめた結果を、できるだけ専門用語を使わずに説明します。

確かめ方は、統計学の論文で使われている方法を借りています(最後に一覧を載せています)。合格ラインは結果を見る前に決め、不合格だったものも、見つかった弱点も、そのまま書きます。決めた内容は検証計画書で確かめられます。計算の手順そのものは計算方法の詳しい解説にあります。

検証の結果のまとめ(2018-19〜2025-26の完了したシーズン)
確かめたこと確かめ方結果
実力推定と90%区間答えを決めた架空のシーズンで答え合わせ✓ 合格
平均へ引き戻す推定の予測力シーズン前半の成績から後半を当てる✓ 合格
運補正量に選手ごとの偏りが残るか同じ選手の別試合を比較△ 明確な偏りは検出されず
持続する選手成分の検出率:分散比20%で約99%、10%で約76%。シーズン内だけの偏りには弱い(4章)
トップ確率・ラス確率「30%」と言った局面の3割で本当にそうなったか△ 小さなずれあり
予測を直せば減らせるずれは、外れ全体の0.2%。場面別では最大1.4ポイントのずれ(5章)

※ 判定は「サイトの数字が正しく働いているか」についてのものです。検査がどれだけ小さな問題まで見つけられるか(検査の感度)は、本文とページ末尾に分けて載せています。

1. 答えが分からない問題を、どう確かめるか

検証でいちばん困るのは、選手の「本当の実力」は誰にも分からないことです。答案はたくさんあるのに、模範解答がないテストのようなものです。「この推定は正しいか」を、正解と見比べて確かめることができません。

そこで、正解が分からなくても確かめられる方法を4つ使いました。

方法たとえると
架空のシーズンで答え合わせ(2章)答えを知っている練習問題を解かせて、採点する
前半で後半を当てる(3章)天気予報を、次の日の天気で答え合わせする
データをかき混ぜて比べる(4章)名札をはがしてシャッフルし、貼り直しても同じ結果になるかを見る
予報の当たり具合を見る(5章)「降水確率30%」の日に、本当に10回中3回くらい雨が降ったかを見る

2. 架空のシーズンで答え合わせをする

本物のデータでは答えが分からないので、答えをこちらで決めた架空のシーズンを作ります。その架空のシーズンにサイトと同じ計算をして、決めておいた答えを当てられるかを見ます。

手順(架空のシーズン1回分)

  1. 実際の対戦表(誰と誰が同じ卓に座ったか)を、そのまま使う。
  2. 各選手に、こちらで決めた「本当の実力」を割り当てる。
  3. 1試合ごとに、過去の本物の試合の点数を1つ選ぶ。それを、実力が高い人ほど上の順位を引きやすいくじで4人に配る。
  4. できた架空のシーズンに、サイトと同じ計算をして、実力推定と90%区間を出す。
  5. 「本当の実力」が90%区間の中に入った選手の割合を数える。

これを、選手の実力差の大きさを6通りに変えて、それぞれ1,000回くり返しました。

90%区間は、「本当の値はこの範囲に入っているはず」という幅です。正しく作れていれば、どんな世界でも9割以上の選手で、本当の値が区間に入るはずです。結果は次のとおりでした。

架空の世界の実力差平均着順ポイント以前の区間(平均着順)
実力差なし100%100%100%
実データの推定の半分99%99%98%
実データの推定と同じ91%92%94%
実データの推定の1.5倍90%90%88%
実データの推定の2倍93%92%87%
実データの推定の3倍94%94%89%

※ 数字は、本当の値が90%区間に入った選手の割合。90%以上なら合格です。「実データの推定」は、本物のデータから推定した選手の実力差の大きさです。

この検証で見つかった弱点と、その直し方

表の右の列は、このサイトが以前使っていた区間の結果です。実力差が大きい世界では、本当の値が区間に入った選手が87%しかなく、区間が狭すぎることが分かりました。

原因は、実力推定が「リーグ平均に引き戻した値」であることです。本当に強い選手ほど、推定値は本当の実力より平均寄り(控えめ)に出ます。弓矢でたとえると、的の中心から少しずれた所を狙っているようなものです。以前の区間は、このずれを計算に入れずに幅を決めていました。

そこで、経済学の論文(Armstrong ほか, 2022)の方法に切り替えました。この方法は、ずれがいちばん大きくなる場合でも9割を守れるように、区間を少しだけ広げます。切り替えた後は、表のとおりどの世界でも9割以上に入るようになりました。

※ その代わり、平均着順やポイントの区間は以前より広くなりました(1シーズン分で、平均着順なら±0.08着から±0.13着ほど)。副露率のように選手の違いがはっきりしている指標は、引き戻しがほとんどないので、区間はほぼ変わりません。

同じ架空のシーズンで、区間の土台になる「選手の実力差の大きさ」の推定も確かめました。実データと同じくらいの実力差の世界で、推定は平均着順で5.8%、ポイントで8.3%しか偏っておらず、推定の幅(90%区間)は、平均着順で87%、ポイントで91%の回で本当の値を含みました。

3. 前半の成績から後半を当てる

実力推定が本当に「実力」を表しているなら、まだ見ていない試合の成績をよく当てるはずです。そこで、各シーズンを前半と後半に分け、前半のデータだけで後半の成績を予測しました(のべ223人)。予測に使う設定も、予測するシーズン以外のデータだけで決めています(答えを見ながら予測しないため)。

予測のしかた平均着順の外れ幅ポイントの外れ幅
前半の実績をそのまま使う0.406着16.1pt
全員リーグ平均と予測する0.299着12.2pt
実力推定(このサイト)0.300着12.2pt
運を除いた実力推定(このサイト)—12.2pt

※ 外れ幅は、予測と後半の実際の成績(1半荘あたり)の差を平均したもの(二乗平均平方根)。小さいほど良い予測です。後半の成績にも運が入るので、完璧な予測でも0にはなりません。

前半の成績をそのまま信じると、外れ幅がはっきり大きくなります。前半に好調だった選手は、後半は平均に近づくのが普通だからです。このサイトの実力推定は、「全員リーグ平均」と予測した場合とほぼ同じ精度でした。半シーズン分のデータでは、実力推定がほとんどリーグ平均と同じ値になるためです。

これは一見がっかりする結果ですが、実は大事な裏づけです。「実力推定がいつも平均に近いのは、計算が慎重すぎるからでは?」という疑問に対して、平均に大きく引き戻すほうが、実際に先の成績をよく当てるという答えになっているからです。

一方で、半シーズンの時点では、「全員リーグ平均」を上回るほど選手ごとの差を言い当てる力は確認できていません。ここで確かめられたのは「平均へ引き戻す考え方が正しい」ことまでで、「選手ごとの推定値の差がそのまま当たる」ことではありません。

3.1 過去のシーズンだけで設定を決めても同じか

上の予測は、設定(どれだけ平均へ引き戻すか)を「予測するシーズン以外」のデータで決めています。これだと、たとえば2020-21の予測に、それより後のシーズンの情報が入ります。そこで、予測するシーズンより前のシーズンだけで設定を決め直しました(2020-21〜2025-26、のべ180人)。

結果は同じで、前半の成績をそのまま信じるより、平均へ引き戻すほうがはっきりよく当たりました。ただし平均着順では、「全員リーグ平均」の方がこのサイトの実力推定よりわずかに良く当たりました。半シーズンの時点では、選手ごとの推定値の差はまだ当てにならない、という上の結論と同じです。

あわせて、「過去のシーズンの成績も足せば、選手の違いを見分けられるのでは」という予測も試しました。その選手の前のシーズンの全試合と今シーズンの前半を1つにまとめ、同じように平均へ引き戻す方法です。結果は逆で、過去の成績を足すと、平均着順・ポイントとも予測はかえって悪くなりました。数シーズン前の好成績は、今シーズン後半の成績をほとんど言い当てません。運の影響が大きいのか、実力そのものが年ごとに変わるのか、その両方なのかは、この検証だけでは分かりません。

※ 過去の試合を、今シーズンの試合と同じ重みで足す方法だけを試しています。古いシーズンほど軽く扱う方法なら結果が変わる可能性がありますが、まだ確かめていません。

4. 運の指標に実力が混ざっていないか

※ 9/28に運の補正を改訂しました。ツモの良さの確率を他家の手牌も除いて数える方法に替え、打ち方の影響が残りやすい一発率を補正から外しました(計算方法 4.1)。ばらつきの減り方は約35%から約28%に小さくなりましたが、確認した条件では巡目による偏りが小さくなり、打ち方の違う簡単な対局プログラムどうしで補正額の差が小さくなりました。一方、押し引きだけが違うプログラムどうしでは差が許容幅に収まることを示せず、続く混入1割を見つける確率も推定76.4%(片側95%下限74.8%)で目標の8割に届いていません。シーズンをまたいで続く選手成分の上限は、計算の規則を先に固めてから求め直し、推定値は0.205になりました。模擬データでは、上限が本当の値を上回った割合が名目の95%を上回りましたが、確かめたのは2種類の条件だけです。これは指定したモデルの下での推定値で、「実際の混入がこの割合以下」という保証ではありません。この割合は、選手・シーズンごとの値のばらつきのうち、シーズンをまたいで続く分の割合で、「実力を20%取り除いた」という意味ではありません。合格ラインは事前に決めたまま変えていません(計画書16章)。

よくある疑問:運と牌効率(実力)は本当に分けられるの?統計の言い回しでごまかしていない?

全部は分けられません。分けられるものだけを分け、それが本当に分けられているかをデータで確かめています。

  1. 運として測るのは、選手が選べないものだけです。配牌(まだ1枚も打っていない)、裏ドラ、一発のように、打ち方で変えられないものに限っています。読み・押し引き・放銃回避のように運と実力が絡み合うものは、運として数えていません。
  2. 牌効率の良さは「運」に入りません。「ツモの良さ」は、選手が実際に残した手牌から「この形なら次のツモで手が進む確率は何%か」を計算し、実際に手が進んだかとの差だけを数えます。牌効率の上手な選手は良い形を残すので「進む確率」そのものが高くなり、その分は運ではなく実力の側に残ります(計算方法 4.1)。
  3. 分け方が間違っていれば、データに跡が残るはずです。もし運の指標に実力が混ざっていたら、上手な選手はいつも「運が良い」側に偏ります。下の4.1では、その偏りがあるかを名札のシャッフルで調べ、運の指標では見つからず、打ち方の指標でははっきり見つかることを確かめています。

「1シーズンの成績差の94%が運」も同じで、言い回しではなく確かめられる主張です。全員が同じ実力だった場合の成績のばらつきを、実際の試合結果をシャッフルして作ると、本物のシーズンのばらつきはその範囲にほぼ収まります(計算方法 2.5)。ただし、これは選手全体の差についての話で、特定の選手の特定の一局が運だったか実力だったかを言い当てるものではありません。

4.1 名札をシャッフルして比べる

「ツモの良さ」などの運の指標は、どの選手でも平均0になるように作っています。ところが、もし測り方を間違えて実力が混ざっていたら、たとえば牌効率の上手な選手がいつも「ツモが良かった」ことになってしまいます。そうなっていないかを、次の方法で確かめました。

手順

  1. 選手ごとのシーズン平均を比べ、「偶然では説明できない選手の差」がどれくらいあるかを計算する。
  2. 同じシーズンの中で、データから選手の名札をはがし、シャッフルして貼り直す。貼り直した後で、同じ計算をする。
  3. これを999回くり返し、貼り直した方が差が大きくなった回数を数える。

名札をシャッフルすれば、選手と運の結びつきは完全に切れます。それでも本物と同じくらいの差が出るなら、本物の差も偶然の範囲ということです。逆に、本物の差がシャッフルした999回のほとんどより大きければ、その指標には選手ごとの差(=実力や打ち方)が混ざっています。この「シャッフルの方が大きかった割合」がp値で、小さいほど「選手の差が本当にある」ことを示します。

運の指標p値選手の差
配牌の良さ(向聴数)1.000見つからない
配牌のドラ・赤1.000見つからない
ツモの良さ1.000見つからない
裏ドラ運1.000見つからない
一発率1.000見つからない
運による獲得ポイント(/半荘)1.000見つからない

※ p値が0.05より小さければ「選手の差あり」と判定します。6つの指標をまとめて調べているので、偶然どれかが引っかかる分を補正しています(Holm法)。

「差が見つからない」ことが、検定のしかたが甘いせいではないことも確かめました。選手ごとに違いがあると分かっている打ち方の指標に、同じ検定をかけています。

比較用の指標(打ち方)p値選手の差
放銃率0.003あり
副露率0.001あり
立直率0.001あり

打ち方の指標でははっきり差が見つかり、運の指標では見つかりませんでした。この検定には差を見つける力があり、そのうえで運の指標には、見つけられる大きさの選手ごとの差(実力の混入)はなかった、ということです。ただし「見つからなかった」は「まったくない」ではありません。どのくらいの混入なら見つけられるのかを、次の4.2で確かめています。

※ 事前に決めた合格ラインでは、比較用の指標は「999回すべてのシャッフルより差が大きいこと(p = 0.001)」でした。放銃率はp = 0.003で、差ははっきり見つかっていますが、このラインには届かなかったので「不合格」と記録しています。ラインが厳しすぎました。

4.2 どのくらいの混入なら見つけられるか

4.1の検定で差が見つからなくても、検定が小さな混入を見逃しているだけかもしれません。そこで、運の指標にわざと実力を混ぜた架空のデータを作り、4.1と同じ検定で見つけられるかを試しました。

混ぜる量は、「1シーズンの値のうち、実力で決まる割合」で表します(このサイトの「実績の重み」と同じ物差しです)。比較用の指標のうち、放銃率はこの割合が約2割で、4.1の検定ではっきり見つかっています。そこで、2割の混入を8割以上の確率で見つけられることを、結果を見る前に合格ラインとして決めました。

運の指標10%混ぜたとき20%混ぜたとき30%混ぜたとき判定(20%)
配牌の良さ(向聴数)0%69%100%✗ 不合格
配牌のドラ・赤0%10%90%✗ 不合格
ツモの良さ0%26%97%✗ 不合格
裏ドラ運0%78%100%✗ 不合格
一発率7%74%99%✗ 不合格
運による獲得ポイント(/半荘)1%60%99%✗ 不合格

※ 数字は、混ぜたデータを200回作ったうち、検定が「選手の差あり」と判定した割合(検出力)。判定は6つの指標をまとめて調べる場合の最も厳しい水準(p ≤ 0.0083)で、シャッフルは1,999回です。

合格ラインに届いた指標はありませんでした。2割の混入を見つけられる確率は10%〜78%にとどまり、3割混ぜてようやく90%〜100%で見つかります。つまり4.1の「運の指標に実力の混入は見つからなかった」が強く言えるのは、1シーズンの値の3割ほどが実力で決まるような大きな混入についてです。 2割程度の混入なら、見逃している可能性がかなりあります。

この方法は実データに混ぜるので、実データにもともとある偶然の選手差がどちらに振れているかで、指標ごとの結果が上下します。参考に、いったん名札をシャッフルして「完全に運だけ」にしたデータに混ぜた場合も調べると、2割の混入を見つける確率はどの指標も40%〜68%でした(この比べ方は結果を見た後に加えたもので、判定には使っていません)。

※ 最初はシャッフルを199回にしていましたが、判定の水準が厳しいため、乱数しだいで結果が大きく変わりました。そこで回数を増やして測り直しています(検証計画書 8.1)。

4.3 シーズンをまたいで続くか、多くてどこまで混ざりうるか

実力が混ざっているなら、その選手には毎シーズン同じ向きに出るはずです。 4.1の検定はシーズンごとに別々に見ていて、この手がかりを使っていませんでした。そこで、同じ選手の違うシーズンどうしで、平均からのずれが同じ向きにそろうかを調べました(名札のシャッフルは1,999回)。

指標シーズンをまたぐ差のp値多くてもこの割合まで(1シーズン)多くてもこの割合まで(シーズンをまたいで続く分)
配牌の良さ(向聴数)1.00021%8%
配牌のドラ・赤1.0006%1%
ツモの良さ1.0009%3%
裏ドラ運1.00013%0%
一発率1.00021%7%
運による獲得ポイント(/半荘)0.36311%14%
放銃率(比較用)0.00622%(推定)10%(推定)
副露率(比較用)0.00182%(推定)81%(推定)
立直率(比較用)0.00133%(推定)28%(推定)

※ 「多くてもこの割合まで」は、1シーズンの値のうち実力で決まる割合(4.2と同じ物差し)の推定を、選手を単位に1,000回抜き直して求めた90%区間の上端です。比較用の指標には推定値そのものを載せています。

運の6指標では、シーズンをまたいで続く選手差は見つかりませんでした(比較用の指標でははっきり見つかります)。上の表の上限(参考値)は、1シーズンの値の6%〜21%、シーズンをまたいで続く分は0%〜14%です。ただし、下の注記のとおり、この上限の出し方は低めに出ることが分かったので、「混ざっていてもこの割合以下」という保証としては扱えません。出し方を作り直すまで、参考値として読んでください。どれも、比較用の放銃率の選手差(22%)より小さい値です。この検定は、続く混入が1シーズンの値の2割あれば88%〜95%の確率で見つけられ、4.2の検定より大きく見つけやすくなっています。ただし事前に決めた「1割の混入を8割以上で見つける」には届きませんでした(37%〜48%)。

※ この上限の出し方そのものも、後から確かめました(計画書15章)。答えを埋め込んだ模擬データで、上限が本当の混入量を上回った割合は、名目の95%に対して、シーズンをまたいで続く分で82〜89%、1シーズンの値で81〜99%(指標による)でした。上の上限は低めに出ていて、「多くてもこの程度」は言いすぎの可能性があります。上限の出し方を見直すまでは、目安として読んでください。

この検証で見つかった、牌譜の記録のしかたの揺れ

最初にこの検定をかけたとき、配牌の良さに「シーズンをまたいで続く選手差」が見つかりました。配牌は打ち方と関係なく配られるので、実力が混ざることはありません。調べると、原因は牌譜での親の配牌の書き方でした。

全自動卓では親に最初から14枚が配られ、どれが「ツモった牌」という区別はありません。ところが牌譜の形式は「13枚配られて1枚ツモる」形なので、書き起こすときにどれかをツモにする必要があります。 2019-20〜2025-26の牌譜の一部では、親が最初に切った牌をツモ、残りを配牌として記録していました(親の最初の打牌がツモ切りになる割合が、子の7〜8%に対して最大26%)。そうすると配牌は「親が選んで残した13枚」になり、実際より良く見えます。連荘の多い選手ほど親の局が多いので、「配牌に恵まれている」ことになっていました。

牌譜の点数や結果は正しく、公式記録とも一致しています。問題は「配牌の13枚は偶然配られた」というこのサイトの前提の方でした。今は、親の配牌を14枚まとめて評価しています(どれをツモと書いてあっても同じ値になります)。親の最初のツモは、ツモの良さからは外しています。直した後は選手差が消え、上の表はすべて直した後の値です(検証計画書 9.1)。

4.4 1試合ずつの組で調べ直す

4.3の検定は「違うシーズンどうし」しか比べず、試合数の違う選手・シーズンを同じ重みで扱っていました。そこで、統計学で「変量効果が0かどうか」を調べる定番のスコア検定(Lin, 1997)の形に直しました。同じ選手の「違う試合どうし」で、平均からのずれが同じ向きにそろうかを見るもので、シーズン内の組もシーズンをまたぐ組も使い、試合の多い選手ほど重く効きます。一発や裏ドラのような「起きたか・起きなかったか」の指標にも、そのままの形で使えます。

運の指標p値続く混入1割を見つける確率(4.3の検定では)続く混入2割
配牌の良さ(向聴数)0.98350%47%98%
配牌のドラ・赤1.00052%46%96%
ツモの良さ1.00052%42%96%
裏ドラ運1.00059%37%99%
一発率1.00058%46%96%
運による獲得ポイント(/半荘)0.44756%48%97%

※ p値は6指標をまとめて調べる分を補正した値(Holm法)。見つける確率は、運だけにしたデータに選手ごとの一定の実力を混ぜて200回試した割合で、4.3と同じ条件です。

運の指標では差は見つからず、比較用の指標(放銃率・副露率・立直率)では、はっきり見つかりました。続く混入1割を見つける確率は50%〜59%で、4.3の検定より上がりましたが、目標の8割には届きませんでした。検定のしかたを替えても伸びが小さいことから、見つけられる大きさの限界は、主にデータの量(選手約50人、1人あたり数シーズン)で決まっていると考えられます。

※ この検定は、シーズンの中だけの混入には弱くなります(2割でも5%〜17%)。組の大半がシーズンをまたぐ組なので、シーズン内の差が薄まるためです。シーズン単位の混入は、4.1と4.2の検定で見ています。

4.5 運の補正は本物か

「運を除いたポイント」は、運の指標を使って、1試合ごとのポイントのばらつきを28%減らしています。でも、ばらつきが減ったのは運の情報のおかげではなく、計算のしくみ自体のせいかもしれません(どんなデータを入れても、少しは減ってしまう、など)。

そこで、運の指標をでたらめに入れ替えてから同じ計算をしました。199回試して、ばらつきの減り方は平均-0.0%で、ほぼ0でした。つまり、どんな特徴量を入れても自動的にばらつきが減る、という現象ではありませんでした。運の指標と成績の対応には、本当の情報があります。ただし、この確認で分かるのはそこまでです。その情報が純粋に運なのか、実力も混ざっているのかは、この方法では区別できません(それを調べるのが4.1〜4.4と4.6です)。

※ 参考までに、天鳳の鳳凰卓の牌譜で同じ考え方を使った研究(大神ほか, 2023)では、AIに局面の有利さを評価させて運を差し引き、成績のばらつきを約46%減らしています。減った分の大半はツモの運によるものでした。このサイトは「引いた牌で向聴数が進んだか」を、引く前の向聴数ごとの価値で重み付けして運を測っています。局面全体を評価するAIよりは単純な物差しなので、減り方はそれより小さくなっています。

4.6 打ち方しだいで運の値がずれないか

運の値は、リーグ全体で平均すると0になるように作っています。でも、条件ごとに分けると0からずれることがあります。たとえばツモの良さ(手が進んだか)は、9/28の改訂前は13巡目以降のツモで1回あたり約1.4ポイント低めに出ていました。改訂後は、ツモの大半を占める門前・非立直のツモで、ずれは0.13ポイント以内です。一発率は、先制立直より追っかけ立直の方が高めに出ます。

もし、条件の偏った打ち方の選手がいれば(終盤まで手を進めることが多い、追っかけ立直が多い、など)、その選手の運の値は、運ではなく打ち方のせいでずれることになります。そこで、各選手について「その選手が入った条件の割合だけから予想される運」を計算し、実際の運の値と比べました(ツモの良さ・裏ドラ運・一発率)。

結果、打ち方から予想される運の、選手ごとの差はごく小さいものでした。選手ページに出している90%区間の半分の幅と比べると、ツモの良さ1%、裏ドラ運3%、一発率12%ほどです。実際の運の値との関係も見つかりませんでした(Holm補正後p = 0.78、0.86、0.86)。

条件ごとの運の値の平均
ツモの良さ(手が進む割合、ツモ1回あたりの、リーグ全体の予想との差)
条件平均件数
門前・非立直・1〜6巡+0.0ポイント421,207
門前・非立直・7〜12巡−0.1ポイント278,471
門前・非立直・13巡〜−0.1ポイント90,238
門前・立直・1〜6巡−0.2ポイント3,384
門前・立直・7〜12巡+0.1ポイント33,299
門前・立直・13巡〜+0.3ポイント31,943
副露・非立直・1〜6巡+0.1ポイント24,672
副露・非立直・7〜12巡+0.0ポイント50,582
副露・非立直・13巡〜−0.0ポイント26,955
副露・立直・1〜6巡−1.7ポイント31
副露・立直・7〜12巡+0.3ポイント533
副露・立直・13巡〜+0.4ポイント1,274
裏ドラ運(裏ドラの枚数、リーチ和了1回あたりの、リーグ全体の予想との差)
条件平均件数
子・追っかけ・〜6巡+0.073枚57
子・追っかけ・7〜9巡-0.034枚257
子・追っかけ・10巡〜+0.009枚675
子・先制・〜6巡+0.005枚1,507
子・先制・7〜9巡+0.042枚1,922
子・先制・10巡〜+0.013枚1,372
親・追っかけ・〜6巡-0.244枚14
親・追っかけ・7〜9巡+0.040枚86
親・追っかけ・10巡〜+0.029枚274
親・先制・〜6巡-0.006枚624
親・先制・7〜9巡+0.040枚873
親・先制・10巡〜-0.024枚693
一発率(一発の割合、リーチ和了1回あたりの、リーグ全体の予想との差)
条件平均件数
子・追っかけ・〜6巡+4.8ポイント57
子・追っかけ・7〜9巡+9.4ポイント257
子・追っかけ・10巡〜+16.5ポイント675
子・先制・〜6巡−7.1ポイント1,507
子・先制・7〜9巡−4.0ポイント1,922
子・先制・10巡〜+5.7ポイント1,372
親・追っかけ・〜6巡+15.9ポイント14
親・追っかけ・7〜9巡+4.6ポイント86
親・追っかけ・10巡〜+16.0ポイント274
親・先制・〜6巡−8.7ポイント624
親・先制・7〜9巡−5.6ポイント873
親・先制・10巡〜+2.9ポイント693

※ 「予想される運」は、その選手を除いた全員の条件ごとの平均を、その選手の条件の割合で平均したものです。自分を除くと、それだけで実際の値との関係が負に傾くので、検定では「同じ条件の中で運の値を入れ替える」方法で偶然の範囲を作りました。この検定のしかたは結果を見た後に変えたもので、最初に決めていた方法の結果(p = 1.00、1.00、0.28)も記録に残しています。どちらでも判定は同じです。

5. トップ確率は当たっているか

5.1 「30%」と言った局面の3割でトップになったか

試合ページのトップ確率は、天気予報の降水確率に似ています。「降水確率30%」は、そういう予報が出た日を集めると、10日のうち3日くらい雨が降る、という意味です。同じように、トップ確率30%と出た局面を全部集めて、そのうち本当にトップになった割合が30%くらいかを調べました。

0%25%50%75%100%0%25%50%75%100%予測した確率予測 0% → 実際 0%(90%の範囲 0%〜0%)予測 10% → 実際 11%(90%の範囲 10%〜12%)予測 20% → 実際 21%(90%の範囲 20%〜22%)予測 30% → 実際 30%(90%の範囲 28%〜32%)予測 40% → 実際 38%(90%の範囲 37%〜41%)予測 50% → 実際 48%(90%の範囲 46%〜51%)予測 60% → 実際 57%(90%の範囲 55%〜60%)予測 70% → 実際 67%(90%の範囲 65%〜73%)予測 80% → 実際 79%(90%の範囲 75%〜82%)予測 90% → 実際 90%(90%の範囲 87%〜92%)予測 100% → 実際 100%(90%の範囲 100%〜100%)
トップ確率。横軸が予測した確率、縦軸が実際にそうなった割合。青線が斜めの点線に重なっていれば、予測どおりの頻度で起きています。網掛けは、データの偶然のぶれを考えた範囲。
0%25%50%75%100%0%25%50%75%100%予測した確率予測 0% → 実際 0%(90%の範囲 0%〜0%)予測 10% → 実際 9%(90%の範囲 8%〜11%)予測 20% → 実際 22%(90%の範囲 19%〜23%)予測 30% → 実際 31%(90%の範囲 29%〜32%)予測 40% → 実際 39%(90%の範囲 37%〜41%)予測 50% → 実際 47%(90%の範囲 45%〜50%)予測 60% → 実際 59%(90%の範囲 56%〜62%)予測 70% → 実際 65%(90%の範囲 63%〜68%)予測 80% → 実際 77%(90%の範囲 74%〜80%)予測 90% → 実際 89%(90%の範囲 86%〜92%)予測 100% → 実際 100%(90%の範囲 100%〜100%)
ラス確率。見方はトップ確率と同じです。

どちらも、青線はほぼ斜めの線に沿っています。予測の外れのうち、「予測を直せば減らせるずれ」の分は、トップで0.2%、ラスで0.2%しかありませんでした。つまり、今の予測を補正するだけでは、外れはほとんど減りません。ただし、これは「これ以上良い予測がない」という意味ではありません。点差や順位などの情報をもっとうまく使えば減らせる余地は、別に調べています(5.4、5.5)。

※ 曲線は、確率を10%ずつの区切りに分けて数える代わりに、「予測が高いほど実際も高い」という形を保ったまま最もよく当てはまる線を引く方法(CORP)で描いています。区切り方で見た目が変わらないのが長所です。

5.2 データが多く見えても、情報は多くない

この検証には94,612件のデータ(各局の開始時点 × 4人)を使いました。ずいぶん多く見えますが、同じ試合の局はすべて、「最後に誰がトップになったか」という同じ答えを共有しています。 1試合から約49件のデータが取れても、答えは1つです。計算してみると、独立なデータに直した情報量は、1試合あたり約8件分しかありませんでした。

これを無視すると、「こんなにデータがあるのだから、ぶれは小さい」と思い込んでしまいます。図の網掛けの範囲は、局ではなく試合を単位にくじ引きし直して計算しています。

5.3 まだ残っている気になる点

さらに厳しく、「予測が正しいとしたら、この程度のずれは偶然で起こるか」を検定しました。 1試合から1局だけを選んで独立なデータにし、予測した確率どおりに結果を999回作り直して、本物のずれと比べます。

ラスはp = 0.921で合格でした。トップはp = 0.037で、合格ライン(0.05より大きいこと)に届きませんでした。予測が30〜40%あたりの局面で、実際のトップ率がやや低めに出ています。

ただし、この結果は1試合からどの局を選ぶかで大きく変わります。局の選び方を変えた別の20通りでは、p値が0.05を下回ったのは0通りでした。ただ、この20通りは最初の結果を見てから加えた確認です。そのため判定は不合格のまま残し、「小さなずれの疑いがある」として、予測は直さずに記録を続けています。

5.4 場面ごとに見ても当たっているか

全体で当たっていても、「リードしている人は高く出すぎ、追う人は低く出すぎ」のように、場面ごとのずれが打ち消し合っているかもしれません。そこで、場(東場・南1〜3局・オーラス)、局の開始時点の順位、親か子かで分けて、予測の平均と実際の割合を比べました。

場面トップラス
予測実際予測実際
開始時1位57.8%56.7%6.5%6.5%
開始時2位20.6%21.4%13.3%13.6%
開始時3位13.0%13.1%23.7%24.9%
開始時4位8.7%8.8%56.4%55.1%
親31.0%30.9%20.8%21.1%
子23.0%23.0%26.4%26.3%

※ 場(東場・南1〜3局・オーラス)だけで分けると、4人の確率の合計が必ず1になるので、予測も実際もいつも25%になります。意味のある比べ方にならないので、表からも検定からも外し、場と順位を組み合わせた結果を下に書きます。また、最終持ち点が同点で順位を分け合った試合(12試合)は、2人を半分ずつ数えています。

トップは合格でした(p = 0.15)。ラスは、場面ごとのずれがあると判定されました(p = 0.024)。局の開始時点で4位の人がそのままラスになる割合は、予測56.4%に対して実際は55.1%で、3位の人は逆に予測より多くラスになっています。ずれの大きさは最大1.4ポイントで、事前に決めた許容幅(±2ポイント)には収まっています。

場と順位を組み合わせると、ずれは終盤に集まっています。オーラスを1位で始めた人のトップ率は予測より2.4ポイント低く、2位で始めた人は2.0ポイント高く出ました。つまり、終盤の逆転は、予測より少し多く起きています。

このサイトのトップ確率は、残りの局の結果を過去の局から無作為に引いて計算しています。点差や順位によって打ち方が変わること(追う人が勝負に出る、リードしている人が守りに入る、など)は入っていません。終盤の逆転を少なく見積もっているのは、この単純化のせいと考えられます。今は予測を直さず、ずれを記録していきます。

5.5 点差だけの簡単な予測式より良いか

「補正で直せるずれが小さい」ことは、「これ以上良い予測がない」ことを意味しません。たとえば、毎回全員に25%と言う予測は、全体の頻度とは合っていても役に立ちません。そこで、点差・残りの局数・親か子か・供託の本数だけを使う簡単な予測式(ロジスティック回帰)と比べました。予測式も、予測するシーズン以外のデータで作っています。

結果、トップ・ラスとも、このサイトのシミュレーションの方が良く当たりました(Brierスコア、トップ0.1332対0.1334、ラス0.1343対0.1352。小さいほど良い)。ただし差は小さく、トップのオーラスに限ると、簡単な予測式の方が良く当たります。5.4の終盤のずれと同じ原因と考えられます。

6. この検証で分からないこと

検証にも限界があります。数字を読むときに、頭の片隅に置いてください。

限界内容
架空のシーズンは仮定で作っている2章の架空のシーズンは、「実力はシーズン中一定」「強さは上の順位の引きやすさに表れる」という仮定で作っています。本物の麻雀がこの仮定から大きく外れていれば、検証も的外れになります。
「差が見つからない」は「差がゼロ」ではない4章で運の指標に選手の差が見つからなかったのは、「今のデータで見つかるほどの差はない」という意味です。ごく小さな実力の混ざりは見逃している可能性があります。
たくさんの基準を同時に見ている合格ラインは全部で82個あります。これだけ多いと、本当は問題がなくても、偶然1つくらい不合格が出るのは自然なことです。
過去のシーズンだけで確かめている検証に使ったのは2018-19〜2025-26です。ルールや選手の顔ぶれが大きく変われば、結果も変わりえます。
順位確率(シーズンの予想)は未検証1シーズンにつき結果は1回しかないため、過去の8シーズン程度では、当たり具合を確かめる材料が足りません。
トップ確率は、点差による打ち方の変化を入れていない5.4のとおり、終盤の逆転を少なく見積もる、小さなずれが見つかっています。場面の分け方は、場・順位・親子の3つだけで、それ以外の場面(大きな点差がある場合など)は細かく確かめていません。

※ 検証はデータ更新(試合の翌朝)のたびにやり直しています。新しい試合が加わると、数字や判定が変わることがあります。何度も検定し直すと、問題がなくても偶然不合格になる回が出るので、ここでの判定は監視のための目安です。1回の不合格だけで予測が崩れたとは判断しません。

コラム:なぜ結果を見る前に合格ラインを決めるのか

「どんな結果なら合格か」を、このサイトでは検証を実行する前に文書で決めています。理由は2つあります。

  1. 後から決めると、どんな結果でも「合格」にできてしまう。壁に矢を放ってから、刺さった所を囲むように的を描けば、必ず真ん中に当たったことになります。結果を見てから基準を選ぶと、知らず知らずのうちに、これと同じことをしてしまいます。
  2. 不合格を隠さない約束になる。先に基準を公開しておけば、都合の悪い結果が出ても、基準を黙って動かすことができません。このページで不合格の項目をそのまま載せているのも、そのためです。

正直な例外

とはいえ、このサイトでも一度、結果を見た後で基準を変えました。2章の架空のシーズンの検証です。最初に決めた基準の1つは、「区間の中で本当の値がどこに来たか」の散らばり方を見るものでした。ところが、この基準は理屈の上で、このサイトのような計算には当てはまらないことが後から分かりました(正しい計算でも不合格になりうる基準でした)。

そこでこの基準を外し、代わりに「実力差の大きさを変えたすべての架空の世界で、本当の値が区間に入る割合が87%以上」という基準を置きました。新しい基準は、以前の区間には厳しい方向の変更です。以前の区間は、新しい基準でも不合格(最低87%)になります。変更の前後の基準と結果は、公開している検証データにも残しています。

いま合格ラインに届いていない項目

  • 放銃率(陽性対照): p:0.003(合格ライン:0.001(全並べ替えを上回る))
  • トップ: 較正の検定 p:0.037(合格ライン:0.05より大)
  • ラス: 局面別のずれの検定 p:0.024(合格ライン:0.05より大)
検査の感度の目標に届いていない項目(18項目)

「わざと実力を混ぜたデータで、検査がそれを見つける確率」の目標です。サイトの数字が正しいかどうかではなく、検査がどれだけ小さな混入まで見つけられるかを表します(4.2〜4.4)。目標と結果は事前に決めたとおりのまま載せ、まとめの表では「正しさ」の判定と分けて扱っています。

  • 配牌の良さ(向聴数): r = 0.2 の混入を見つける確率:0.685(目標:0.8以上)
  • 配牌のドラ・赤: r = 0.2 の混入を見つける確率:0.100(目標:0.8以上)
  • ツモの良さ: r = 0.2 の混入を見つける確率:0.255(目標:0.8以上)
  • 裏ドラ運: r = 0.2 の混入を見つける確率:0.780(目標:0.8以上)
  • 一発率: r = 0.2 の混入を見つける確率:0.740(目標:0.8以上)
  • 運による獲得ポイント(/半荘): r = 0.2 の混入を見つける確率:0.595(目標:0.8以上)
  • 配牌の良さ(向聴数): 持続する r = 0.1 の混入を見つける確率:0.465(目標:0.8以上)
  • 配牌のドラ・赤: 持続する r = 0.1 の混入を見つける確率:0.460(目標:0.8以上)
  • ツモの良さ: 持続する r = 0.1 の混入を見つける確率:0.415(目標:0.8以上)
  • 裏ドラ運: 持続する r = 0.1 の混入を見つける確率:0.365(目標:0.8以上)
  • 一発率: 持続する r = 0.1 の混入を見つける確率:0.455(目標:0.8以上)
  • 運による獲得ポイント(/半荘): 持続する r = 0.1 の混入を見つける確率:0.480(目標:0.8以上)
  • 配牌の良さ(向聴数): 持続する r = 0.1 の混入を試合単位の検定で見つける確率:0.500(目標:0.8以上)
  • 配牌のドラ・赤: 持続する r = 0.1 の混入を試合単位の検定で見つける確率:0.520(目標:0.8以上)
  • ツモの良さ: 持続する r = 0.1 の混入を試合単位の検定で見つける確率:0.520(目標:0.8以上)
  • 裏ドラ運: 持続する r = 0.1 の混入を試合単位の検定で見つける確率:0.585(目標:0.8以上)
  • 一発率: 持続する r = 0.1 の混入を試合単位の検定で見つける確率:0.580(目標:0.8以上)
  • 運による獲得ポイント(/半荘): 持続する r = 0.1 の混入を試合単位の検定で見つける確率:0.560(目標:0.8以上)
すべての合格ラインと判定の一覧(82項目)
項目値合格ライン判定
平均着順: 90%区間の被覆率(τ=τ̂)0.9130.87〜0.93✓ 合格
平均着順: 被覆率の最小(τ=0.5〜3τ̂)0.9020.87以上✓ 合格
平均着順: 被覆率(τ=0)10.90以上✓ 合格
平均着順: 真の分散の推定の偏り(中央値、τ=τ̂)-0.058±15%以内✓ 合格
平均着順: kの90%区間が真のkを含む割合(τ=τ̂)0.8650.80以上✓ 合格
ポイント: 90%区間の被覆率(τ=τ̂)0.9200.87〜0.93✓ 合格
ポイント: 被覆率の最小(τ=0.5〜3τ̂)0.9020.87以上✓ 合格
ポイント: 被覆率(τ=0)10.90以上✓ 合格
ポイント: 真の分散の推定の偏り(中央値、τ=τ̂)0.083±15%以内✓ 合格
ポイント: kの90%区間が真のkを含む割合(τ=τ̂)0.9100.80以上✓ 合格
ポイント: 縮小の相対TSE(90%区間の上限)0.1441未満✓ 合格
ポイント: 縮小−全体平均(相対TSEの差の90%区間)-0.013〜0.0090を含むか、上限が0未満✓ 合格
平均着順: 縮小の相対TSE(90%区間の上限)0.1311未満✓ 合格
平均着順: 縮小−全体平均(相対TSEの差の90%区間)-0.002〜0.0160を含むか、上限が0未満✓ 合格
ポイント: 過去だけで決めた縮小の相対TSE(90%区間の上限)0.0741未満✓ 合格
平均着順: 過去だけで決めた縮小の相対TSE(90%区間の上限)0.0361未満✓ 合格
配牌の良さ(向聴数): 選手差の検定(Holm補正後p)10.05より大✓ 合格
配牌のドラ・赤: 選手差の検定(Holm補正後p)10.05より大✓ 合格
ツモの良さ: 選手差の検定(Holm補正後p)10.05より大✓ 合格
裏ドラ運: 選手差の検定(Holm補正後p)10.05より大✓ 合格
一発率: 選手差の検定(Holm補正後p)10.05より大✓ 合格
運による獲得ポイント(/半荘): 選手差の検定(Holm補正後p)10.05より大✓ 合格
放銃率(陽性対照): p0.0030.001(全並べ替えを上回る)✗ 不合格
副露率(陽性対照): p0.0010.001(全並べ替えを上回る)✓ 合格
立直率(陽性対照): p0.0010.001(全並べ替えを上回る)✓ 合格
配牌の良さ(向聴数): r = 0.2 の混入を見つける確率0.6850.8以上✗ 不合格
配牌のドラ・赤: r = 0.2 の混入を見つける確率0.1000.8以上✗ 不合格
ツモの良さ: r = 0.2 の混入を見つける確率0.2550.8以上✗ 不合格
裏ドラ運: r = 0.2 の混入を見つける確率0.7800.8以上✗ 不合格
一発率: r = 0.2 の混入を見つける確率0.7400.8以上✗ 不合格
運による獲得ポイント(/半荘): r = 0.2 の混入を見つける確率0.5950.8以上✗ 不合格
配牌の良さ(向聴数): シーズンをまたぐ選手差の検定(Holm補正後p)10.05より大✓ 合格
配牌のドラ・赤: シーズンをまたぐ選手差の検定(Holm補正後p)10.05より大✓ 合格
ツモの良さ: シーズンをまたぐ選手差の検定(Holm補正後p)10.05より大✓ 合格
裏ドラ運: シーズンをまたぐ選手差の検定(Holm補正後p)10.05より大✓ 合格
一発率: シーズンをまたぐ選手差の検定(Holm補正後p)10.05より大✓ 合格
運による獲得ポイント(/半荘): シーズンをまたぐ選手差の検定(Holm補正後p)0.3630.05より大✓ 合格
放銃率(陽性対照): シーズンをまたぐ選手差のp0.0060.01未満✓ 合格
副露率(陽性対照): シーズンをまたぐ選手差のp0.0010.01未満✓ 合格
立直率(陽性対照): シーズンをまたぐ選手差のp0.0010.01未満✓ 合格
配牌の良さ(向聴数): 持続する r = 0.1 の混入を見つける確率0.4650.8以上✗ 不合格
配牌のドラ・赤: 持続する r = 0.1 の混入を見つける確率0.4600.8以上✗ 不合格
ツモの良さ: 持続する r = 0.1 の混入を見つける確率0.4150.8以上✗ 不合格
裏ドラ運: 持続する r = 0.1 の混入を見つける確率0.3650.8以上✗ 不合格
一発率: 持続する r = 0.1 の混入を見つける確率0.4550.8以上✗ 不合格
運による獲得ポイント(/半荘): 持続する r = 0.1 の混入を見つける確率0.4800.8以上✗ 不合格
配牌の良さ(向聴数): 1シーズンの値のうち実力の割合(95%上限)0.2120.23(放銃率の推定値)より小✓ 合格
配牌のドラ・赤: 1シーズンの値のうち実力の割合(95%上限)0.0600.23(放銃率の推定値)より小✓ 合格
ツモの良さ: 1シーズンの値のうち実力の割合(95%上限)0.0900.23(放銃率の推定値)より小✓ 合格
裏ドラ運: 1シーズンの値のうち実力の割合(95%上限)0.1260.23(放銃率の推定値)より小✓ 合格
一発率: 1シーズンの値のうち実力の割合(95%上限)0.2120.23(放銃率の推定値)より小✓ 合格
運による獲得ポイント(/半荘): 1シーズンの値のうち実力の割合(95%上限)0.1120.23(放銃率の推定値)より小✓ 合格
配牌の良さ(向聴数): 試合単位のスコア検定(Holm補正後p)0.9830.05より大✓ 合格
配牌のドラ・赤: 試合単位のスコア検定(Holm補正後p)10.05より大✓ 合格
ツモの良さ: 試合単位のスコア検定(Holm補正後p)10.05より大✓ 合格
裏ドラ運: 試合単位のスコア検定(Holm補正後p)10.05より大✓ 合格
一発率: 試合単位のスコア検定(Holm補正後p)10.05より大✓ 合格
運による獲得ポイント(/半荘): 試合単位のスコア検定(Holm補正後p)0.4470.05より大✓ 合格
放銃率(陽性対照): 試合単位のスコア検定のp0.0030.01未満✓ 合格
副露率(陽性対照): 試合単位のスコア検定のp0.0010.01未満✓ 合格
立直率(陽性対照): 試合単位のスコア検定のp0.0010.01未満✓ 合格
配牌の良さ(向聴数): 持続する r = 0.1 の混入を試合単位の検定で見つける確率0.5000.8以上✗ 不合格
配牌のドラ・赤: 持続する r = 0.1 の混入を試合単位の検定で見つける確率0.5200.8以上✗ 不合格
ツモの良さ: 持続する r = 0.1 の混入を試合単位の検定で見つける確率0.5200.8以上✗ 不合格
裏ドラ運: 持続する r = 0.1 の混入を試合単位の検定で見つける確率0.5850.8以上✗ 不合格
一発率: 持続する r = 0.1 の混入を試合単位の検定で見つける確率0.5800.8以上✗ 不合格
運による獲得ポイント(/半荘): 持続する r = 0.1 の混入を試合単位の検定で見つける確率0.5600.8以上✗ 不合格
分散の減少率の検定: p0.0050.005(全並べ替えを上回る)✓ 合格
並べ替え後の減少率(平均)-0.000±1%以内✓ 合格
luck_draw: 打ち方から予想される運との相関(Holm補正後p)0.7810.05より大✓ 合格
luck_ura: 打ち方から予想される運との相関(Holm補正後p)0.8570.05より大✓ 合格
luck_ippatsu: 打ち方から予想される運との相関(Holm補正後p)0.8570.05より大✓ 合格
トップ: 較正の検定 p0.0370.05より大✗ 不合格
トップ: MCB / Brier0.0022%未満✓ 合格
ラス: 較正の検定 p0.9210.05より大✓ 合格
ラス: MCB / Brier0.0022%未満✓ 合格
トップ: 局面別のずれの検定 p0.1480.05より大✓ 合格
トップ: 局面別のずれの最大(9分類)0.011±2ポイント以内✓ 合格
トップ: 点差の予測式よりBrierが小さい(差の90%区間の上限)-0.0000未満✓ 合格
ラス: 局面別のずれの検定 p0.0240.05より大✗ 不合格
ラス: 局面別のずれの最大(9分類)0.014±2ポイント以内✓ 合格
ラス: 点差の予測式よりBrierが小さい(差の90%区間の上限)-0.0010未満✓ 合格

参考にした論文

  • Talts, Betancourt, Simpson, Vehtari, Gelman. "Validating Bayesian Inference Algorithms with Simulation-Based Calibration." arXiv:1804.06788, 2018. — 答えを決めた架空のデータで計算を確かめる方法(2章)
  • Armstrong, Kolesár, Plagborg-Møller. "Robust Empirical Bayes Confidence Intervals." Econometrica 90(6), 2022. — 平均に引き戻した推定値の90%区間の作り方(2章)
  • Morris. "Parametric Empirical Bayes Inference: Theory and Applications." Journal of the American Statistical Association 78(381), 1983. — 以前使っていた区間の考え方(2章)
  • Laird, Louis. "Empirical Bayes Confidence Intervals Based on Bootstrap Samples." Journal of the American Statistical Association 82(399), 1987. — 試したが採用しなかった区間の作り方(2章)
  • Brown. "In-season prediction of batting averages: A field test of empirical Bayes and Bayes methodologies." Annals of Applied Statistics 2(1), 2008. — シーズン前半から後半を当てる検証(3章)
  • Burch, Schmid, Moravčík, Bowling. "AIVAT: A New Variance Reduction Technique for Agent Evaluation in Imperfect Information Games." AAAI, 2018. — 運を差し引いてばらつきを減らす考え方と、その前提(4章)
  • 大神卓也・天野克敏・奈良亮耶・鶴岡慶雅「分散減少法を用いた麻雀における実力推定」ゲームプログラミングワークショップ2023論文集, pp.76–82, 2023. — 麻雀で同じ考え方を使い、ばらつきを約46%減らした例(4章)
  • Phipson, Smyth. "Permutation P-values Should Never Be Zero." Statistical Applications in Genetics and Molecular Biology 9(1), 2010. — シャッフルによる検定のp値の出し方(4・5章)
  • Holm. "A Simple Sequentially Rejective Multiple Test Procedure." Scandinavian Journal of Statistics 6(2), 1979. — 複数の検定をまとめて行うときの補正(4章)
  • Dimitriadis, Gneiting, Jordan. "Stable reliability diagrams for probabilistic classifiers." PNAS 118(8), 2021. — 予測確率の当たり具合の図(CORP)とずれの測り方(5章)
  • Brill, Yurko, Wyner. "Exploring the difficulty of estimating win probability: a simulation study." Journal of Quantitative Analysis in Sports 22(1), 105–115, 2026. doi:10.1515/jqas-2024-0130(arXiv:2406.16171, 2024) — 同じ試合のデータは独立ではなく、見た目ほど情報がないこと(5章)
  • Field, Welsh. "Bootstrapping clustered data." Journal of the Royal Statistical Society: Series B 69(3), 2007. — まとまりのあるデータは、まとまりごとにくじ引きし直すこと(5章)

本ページの内容は統計的な検証の解説であり、計算結果はMリーグ機構の公式発表ではありません。数字は試合翌朝の自動更新で最新のデータに置き換わります。