お昼になると長い列ができる学食。明日は何時ごろ混むのか、食材をどのくらい用意すればよいのか。これまでの利用人数や曜日、天気から考えられそうですが、数字を集めるだけで答えが出るわけではありません。

「データサイエンス・統計」分野は、データから現象を理解し、推定や予測を行い、その答えをどこまで信頼できるか確かめる分野です。計算する技術とともに、「何を知りたいか」「何を集めるべきか」「結果から何を言えるか」を考えます。

この記事では、学食の混雑を調べる例から、大学での学びを見ていきます。[1]

学食の混雑を調べるなら、何から始める?

まず、知りたいことを決める

「混んでいる」を、列に並ぶ人数で測るのか、料理を受け取るまでの時間で測るのか。知りたいことが違えば、必要な記録も変わります。仕入れを考えるなら一日の販売数、待ち時間を減らすなら時間帯別の到着人数や提供時間が手がかりになります。

このように、漠然とした困りごとを、調べられる問いへ変えるところから始めます。大学で学ぶ内容にも、何を調べるかを決め、データを観察し、グラフなどで特徴を確かめることが含まれます。[2]

集めたデータが何を表しているか確かめる

晴れた月曜日だけ調べても、雨の日や試験期間の様子は分かりません。記録が抜けた時間帯を0人として扱えば、実際より空いていたことになってしまいます。

グラフにして曜日や時間帯の違いを見たり、欠けた記録の理由を調べたりして、分析に使える範囲を考えます。個人の行動を記録する必要があるのか、人数の集計だけで目的を満たせるのかも、設計の段階で検討します。

予測を作り、使っていないデータで試す

まずは「過去の同じ曜日の平均」といった簡単な予測を作れます。そのうえで、天気なども使う方法に変えると、予測のずれが小さくなるかを調べます。

予測を作るために使った期間と、確かめる期間を分けることも大切です。過去の記録にうまく合うことと、翌週にも役立つことは同じではありません。混雑を少なめに予測して食材が不足する場合と、多めに予測して余る場合では、間違いの影響も違います。何をもって「よい予測」とするかまで考えます。

平均だけでは見えない、人数のばらつきを調べる

一週間の一日平均が200人でも、毎日ほぼ200人の学食と、100人の日も300人の日もある学食では、仕入れの難しさが違います。平均に加え、どのくらい人数がばらつくかを調べる意味はここにあります。

また、たまたま調べた一週間が、普段の利用状況をよく表しているとは限りません。一部の記録から全体について考える「推定」では、調べた日や人の選び方と、答えにどれくらい不確かさが残るかを扱います。

分析では、グラフや数字を出すだけでなく、「この期間の記録からはここまで言える」と説明します。使ったデータと手順を残し、別の人が確かめられるようにすることも大切です。

AI・データベースとの違いと重なり

学食の利用人数を機械学習で予測する場合、「AI・機械学習」分野と「データサイエンス・統計」分野の両方が関わります。例えば、データから学習する方法や、学習に使わなかったデータにも予測が通用する条件を調べることは、「AI・機械学習」分野の研究課題です。認識・推論・計画などを支える仕組みや、その理論も扱います。[3]

「データサイエンス・統計」分野では、どのようにデータを集めれば知りたいことを調べられるか、結果のばらつきや不確かさをどう表すか、といった問いを扱います。両分野とも、理論や分析・学習の手法そのものを研究することと、現実の課題へ応用することを含みます。統計的な学習理論など、重なる内容も多くあります。大学を選ぶときは、分野名だけで区切らず、授業や研究でどんな問いに取り組むかを見るとよいでしょう。

「データベース・Webサービス」分野は、記録を蓄え、必要な情報を取り出し、一貫した状態で管理する仕組みに重点があります。大量の記録を扱う分析では、両方の知識が役立ちます。

大学で学ぶ科目

学部では、確率・統計、線形代数、微積分、プログラミングを土台に、データの整理・可視化、回帰分析などを学びます。回帰分析は、例えば曜日や天気と学食の利用人数の関係を、式で表して調べる方法です。演習では、記録の不足を点検し、予測を作り、予測に使わなかった日の人数と比べて結果を説明します。[2]

大学院では、統計モデルや学習理論などの専門科目を深め、論文を読んだうえで自分の研究課題に取り組みます。研究の例には、少ないデータでも推定の不確かさを適切に表す方法を考えることや、記録が偏った状況で分析結果をどう確かめるか調べることがあります。京都大学のデータ科学コースでは、統計科学の基礎に加え、統計的学習理論などの科目、セミナー、特殊研究が案内されています。[4]

分析の方法を研究したいのか、医療・経済・社会などのデータを調べたいのかによって、必要な専門は変わります。専門科目、演習で扱うデータ、研究指導の内容を確認することが大切です。

「データサイエンス・統計」分野を学べる大学学部・大学院を探すから、データの収集・分析・説明をどう学ぶか見比べてみましょう。

仕事・業界ガイドでは、仕事内容から関連する分野を確認したり、学びたい分野から仕事を調べたりできます。

tojihubの情報分野の区分について

tojihubは、データの分析・統計的な推測・モデル化を、この「データサイエンス・統計」分野として整理しています。

CS2023と科研費の区分を参考にしています。参照した区分と、各分野に含める内容・隣接分野との関係は、「18の分野について」のページで説明しています。

参考文献・注釈

  1. [1]
    学食の混雑は学び方を説明するための例です。特定大学で実施されている授業や調査結果を紹介するものではありません。 本文へ戻る
  2. [2]
    数理・データサイエンス・AI教育強化拠点コンソーシアム「応用基礎レベルのモデルカリキュラム」、2024/02/22改訂。教育の位置づけ、データサイエンス基礎、実課題を用いた演習の説明を参照。全専門課程の共通履修要件ではありません。 本文へ戻る(1) 本文へ戻る(2)
  3. [3]
    ACM・IEEE-CS・AAAI『Computer Science Curricula 2023』最終報告、Artificial Intelligenceの領域。学習理論・未知のデータへの予測・知識表現・推論・計画を参照。 本文へ戻る
  4. [4]
    京都大学情報学研究科「データ科学コースカリキュラム」。修士課程の基礎・専門科目と研究指導の構成を参照。本文の分析課題は説明用の例です。 本文へ戻る