階級の幅の求め方と決め方|度数分布表からスタージェスの公式まで徹底解説

目次
階級の幅の求め方と決め方|度数分布表からスタージェスの公式まで徹底解説
階級の幅の求め方と決め方|度数分布表からスタージェスの公式まで徹底解説
@ creator • Click to Play Video Inline
🎵 階級の幅の求め方と決め方|度数分布表からスタージェスの公式まで徹底解説

テストの点数分布や顧客の購買データなどを分析する際、多くの人が最初に直面するのが「階級の幅をいくつに設定すべきか」という悩みです。度数分布表やヒストグラムを作成しようとしても、幅が広すぎればデータのばらつきが見えなくなり、狭すぎれば細切れになって全体像がつかめません。

中学数学の「データの活用(資料の活用)」で習う基礎計算から、実務のデータ分析における最適な設定基準まで、階級の幅には明確なセオリーが存在します。本稿では、階級値との違いや計算のコツ、境界値の扱い、Excelでの実践手法まで、現場で迷わないための判断軸を網羅して解説します。

📌 【この記事の重要ポイントまとめ】
  • 要点1:階級の幅は「各区間の大きさ」であり、(最大値 − 最小値)÷ 階級数を目安にキリの良い数値で設定するのが鉄則。
  • 要点2:データ数に応じた階級数の決定にはスタージェスの公式が有効であり、境界値(以上・未満)の重複を防ぐルール統一が必須。
  • 要点3:階級値(区間の中央値)や相対度数・累積度数を正しく算出すれば、Excel等での実務分析やヒストグラムの精度が劇的に向上する。

【基本と公式】階級の幅はどう決める?求め方と階級値の計算手順

データ分析の第一歩は、散らばった数値を意味のあるグループ(区間)に区切る作業です。この区切られた1つひとつの区間を「階級」と呼び、その区間の広がりを階級の幅と呼びます。

中学数学の基礎から実務の集計まで共通する、基本的な求め方の手順は以下の通りです。

1. データの範囲(レンジ)を把握する
集めたデータ全体の「最大値」から「最小値」を引いて、全体の散らばりの大きさを求めます。
データの範囲 = 最大値 − 最小値

2. 階級の数を決める
一般的に、全体の階級数は5〜10個程度に収めると見やすい分布になります。データ数が多い場合は、後述するスタージェスの公式を活用します。

3. 階級の幅を計算する
データの範囲を希望する階級数で割り、区間の大きさを算出します。
階級の幅の目安 =(最大値 − 最小値)÷ 階級数
計算結果が中途半端な端数になった場合は、5刻み、10刻みなど、人間が直感的に理解しやすいキリの良い整数に切り上げて設定します。

ここで混同しやすいのが階級値の計算方法です。階級値とは「その階級を代表する中央の値」を指します。

階級値 =(階級の下限値 + 階級の上限値)÷ 2

例えば「50点以上60点未満」という階級の場合、階級の幅は「60 − 50 = 10点」であり、階級値は「(50 + 60) ÷ 2 = 55点」となります。この2つを取り違えると、その後の平均値計算やグラフ描画がすべて狂ってしまうため注意が必要です。

当時のメディア報道・掲載写真
【検証資料 1】当時のメディア報道・掲載写真(出典:univ-juken.com)

度数分布表とヒストグラムの作り方|度数・累積度数・相対度数の算出

階級の幅が決まったら、実際にデータを整理して度数分布表を組み立てていきます。度数分布表とは、各階級にデータがいくつ含まれているかを示した一覧表です。

度数分布表を構成する主要な要素は以下の3点です。

  • 度数:その階級に属するデータの個数(人数や件数など)。
  • 累積度数:最小の階級からその階級までの度数を順に足し合わせた合計値。全体の中でどの位置までデータが積み上がっているかを把握する際に用います。
  • 相対度数:全体に対するその階級の割合。相対度数 = その階級の度数 ÷ データの総数 で算出します(合計は必ず1.00になります)。

この度数分布表を視覚的にグラフ化したものがヒストグラムです。横軸に階級(区切り)、縦軸に度数(または相対度数)を取り、柱状に並べてデータの散らばり具合を可視化します。

ヒストグラムにおいて、階級の幅は「柱の横幅」に直結します。幅が均一でないと面積と度数の比例関係が崩れて誤認を招くため、原則としてすべての階級の幅を等しく揃えることが鉄則です。

【実践データ比較】データ数ごとの階級の幅の目安と設定基準

適切な階級の幅を決めるには、サンプルサイズ(データ数 $N$)に応じた客観的な基準を持つことが不可欠です。統計学で広く使われるスタージェスの公式(Sturges' rule)は、階級数 $k$ を求める代表的な指標です。

階級数 k ≒ 1 + log2(N)(または k ≒ 1 + 3.322 × log10(N))

以下に、実務や学習現場で指標となるデータ規模別の設定基準をまとめました。

データ規模(件数 N)推奨される階級数(k)階級の幅の設定目安編集部の見解・実務上の注意点
小規模(N = 20〜50)
学校のクラス単位のテスト等
5 〜 6 個5刻み、10刻み細かく分けすぎると「度数0」の階級が多発し、分布の山が崩れるため注意。
中規模(N = 100〜300)
学年全体の成績、店舗の顧客調査
7 〜 9 個(範囲 ÷ 8)を四捨五入したキリ値スタージェスの公式が最も安定して機能する領域。正規分布に近い形状を確認しやすい。
大規模(N = 1,000以上)
Webアクセス解析、購買ログ
11 〜 15 個要件に応じた固定幅(100円、1000円刻み等)スタージェス公式だと階級数が過小になる場合があるため、スコットの公式等の併用を推奨。
活動歴および当時の関連ビジュアル記録
【検証資料 2】活動歴および当時の関連ビジュアル記録(出典:mathlandscape.com)

【実態検証】中学数学から実務Excel分析まで!現場でつまずくリアルな落とし穴

教育現場やビジネスの実務において、階級の幅を扱う際に多くの人がつまずく共通パターンがあります。知恵袋やSNSなどのコミュニティ、実務研修の場でも頻出する現場の課題を検証します。

まず、中学数学のテストにおける落とし穴です。定期テストや高校入試では、「階級の幅を答えなさい」という問いに対して単位を書き忘れたり、階級値と取り違えて中間値を答えてしまう失点が目立ちます。問題文が「〇〇以上△△未満」と指定している場合、幅は単純な引き算(上限 − 下限)で求められます。

次に、Excel(エクセル)を用いた実務分析での落とし穴です。Excelで度数分布表を作る際、以下の2つのアプローチで混乱が生じやすくなっています。

  • FREQUENCY関数を使う場合:区間配列(bin)に指定した数値は、デフォルトで「その数値以下」として扱われます。中学数学で標準的な「以上・未満」と境界の解釈が逆になるケースがあるため、区切り値の設定に注意が必要です。
  • 標準のヒストグラム機能を使う場合:Excelの自動設定(自動ビン分割)に頼ると、「12.34〜24.68」といった人間にとって直感的に理解しづらい端数の階級幅が生成されてしまいます。「軸の書式設定」から「ビンの幅」を手動で整数(例:10や50)に固定することが実務レポート作成時の基本マナーです。

一般に知られていない盲点と境界値(以上・未満)の誤解

度数分布表を作成する際、最もミスが起きやすいのが境界値の取り扱いルールです。

例えば「10〜20」「20〜30」と表記した場合、数値「20」がどちらに含まれるかが曖昧になります。データ集計では、以下のいずれかの基準を全区間で一貫して適用しなければなりません。

  • 「以上・未満」パターン(一般的):10以上20未満(10は含む、20は含まない)
  • 「超・以下」パターン:10超20以下(10は含まない、20は含む)

日本の学校教育や統計調査では「以上・未満」が標準ですが、システム開発や金融データでは「超・以下」が採用されることもあります。同一データセット内でこれが混在すると、境界値が重複カウントされたり、集計から脱落したりする重大な集計ミスを招きます。

【プロの結論】データ分析で失敗しないための判断基準

階級の幅をどう決めるべきか迷った際は、データの利用目的に立ち返って以下の基準で判断することをおすすめします。

階級の幅を狭く(階級数を多く)すべきケース:

  • データ件数が数千件以上と十分にあり、微細な外れ値や二峰性のピーク(山が2つある現象)を検出したいとき。
  • 精密な機械加工の公差測定や、詳細なログ分析を行うとき。

階級の幅を広く(階級数を少なく)すべきケース:

  • データ数が少なく(50件未満)、大まかな傾向や全体のボリュームゾーンを素早く把握したいとき。
  • 経営陣やクライアント向けのプレゼン資料など、直感的なわかりやすさが最優先されるとき。

データ分析の本質は「意思決定に役立つパターンを見つけ出すこと」にあります。数学的な公式(スタージェスの公式など)を絶対的な正解と捉えるのではなく、関係者が一目で理解できる認知のしやすさ(キリの良さ)とのバランスを意識することが、実務で成果を出すアナリストの共通原則です。

公の場での発言・インタビュー報道記録
【検証資料 3】公の場での発言・インタビュー報道記録(出典:univ-juken.com)

【階級の幅】に関するよくある質問(FAQ)

Q1:階級の幅は途中で変えてもよいですか?
A1:原則として、すべての階級で幅を統一しなければなりません。途中で幅を変えると、ヒストグラムの柱の面積と度数の関係が崩れ、データの密度を誤認させてしまう原因になります。ただし、極端な外れ値が存在する場合に限り、最上位や最下位を「100以上」のようにオープンエンド(上限・下限なし)として別枠処理することは例外的に認められます。

Q2:階級の幅と「階級値」の違いは何ですか?
A2:階級の幅は「各区間の長さ・間隔(上限 − 下限)」を指します。一方、階級値は「その階級の中央の値(上限 + 下限 ÷ 2)」を指します。例えば「40以上60未満」の場合、階級の幅は20、階級値は50となります。

Q3:データに小数が含まれる場合の階級の幅はどう設定すればいいですか?
A3:小数を含むデータでも基本的な考え方は同じです。データの最小単位に合わせて、例えば「0.5刻み」や「0.1刻み」といった扱いやすいキリの良い数値に幅を設定します。境界値の判定(例:0.5以上1.0未満)を明確に定義して集計を進めてください。

まとめ:適切な階級の幅の設定がデータの本質を浮き彫りにする

階級の幅は、単なるグラフの目盛り設定にとどまらず、データから引き出せるインサイトの質を左右する重要なパラメータです。機械的にツールへ任せるのではなく、データ数に応じた適切な階級数を想定し、キリの良い幅を選定することが求められます。

「全体の散らばりを把握する」「境界値のルールを揃える」「人間が解釈しやすい単位に落とし込む」という基本原則を徹底し、学習のテスト対策やビジネスの実務分析において、説得力のある正確なデータ活用を実践してください。 (出典: 階級 の 幅(Yahoo!ニュース))

階級 の 幅
階級 の 幅
階級 の 幅