ch1統計学とは
1.1 データを分析する
データ分析の目的:
- データを要約する、like average data
- 対象を説明する
- 対象が持つ、関係性を明らかにし理解につながる。
- 前提条件:すべての関係がない可能性を排除する必要があります。
- 説明のレベル:因果関係、相関関係
- 因果関係:二つのうち、一方の要因を変化させると、もう一方を変えることができる関係である。
- for example: 新薬と血圧
- 相関関係:一方が大きいと、もう一方も大きい(小さい)と関係。
- for example: 年収と幸福度
- 未知のデータを予測する。
1.2 統計学の役割
- ばらつきがある(不確実性)データに立ち向かい、説明や予測を行う。
- 不確実性を対処する方法として:
- 確率を使う
1.3 統計学の全体像
統計学を概観として、there are two types here.
- 記述統計:得られたデータを整理し要約する手法
- 推測統計:得られたデータからの発生元の対象を推測する統計手法。
推測統計
从数据推出模型,再用模型做预测就是推测统计。Step is like:
- data
- 確率モデル
- 予測・説明
推測統計には、二つある:
統計的推定:データから仮定した確率モデルの性質を推定する方法,从样本推出总体特征
- 比如,求全村人的平均年龄
- 先抽样
- 计算平均值
- 设置置信区间
- 然后比较得出结果
- 比如,求全村人的平均年龄
仮設検定:立てた仮設と得られたデータがどれだけ整合するかを評価し、仮説を支持するかどうかを判断する手法である。
假设检验
step
提出假设(H0,H1),H1是希望证明的假设,通常表明存在某种效应或者关联。
收集数据
确定检验方法(T检验,F检验之类的)
确定显著水平
和显著水平做比较,做结论,并解释结果。
Ch2 母集団を標本
2.1データ分析の目的と興味の対象
2.2 母集団(population)
- sizeにより、有限母集団と無限母集団ある。
2.3 母集団の性質
母集団の性質を知るために、以下の方法ある
- 全数調査 (分析するdata = 母集団)、記述統計
- 標本調査
- 母集団の一部を分析することで、母集団全体の性質を推測する推測統計である
- sample size is important in this situation
ch3 統計分析の基礎
3.1 data's type
- 変数
- 量的変数:離散、連続
- 質的変数(カテゴリ変数): 分类变量,eg:geder 1/0
3.2 data distribution
- dataの可視化
- 離散:
- 散点图 - Scatter Plot
- 柱状图 - Bar Chart
- 折线图 - Line Chart
- 盒须图 - Box Plot
- 饼图 - Pie Chart
- 热力图 - Heatmap
- 連続:
- Line chart - 折线图
- Scatter plot - 散点图
- Curve chart - 曲线图
- Area chart - 面积图
- Bar chart - 柱状图
- Histogram - 直方图
- Kernel density estimate plot - 核密度估计图
- Box plot - 箱线图
- Heatmap - 热力图
- Contour plot - 等高线图
- 離散:
3.3 統計量
データの性質を要約するための統計量を記述統計量また要約統計量と呼ぶ。
- 記述統計量(descriptive statistics)(描述数据基本特征)
- 平均値
- 中央値(中位数)
- 最頻値(众数)
- ばらつきを表す値(measure of dispersion)(表达离散程度)
- 標準偏差(std)(standard deviation)、值越大,图像越扁
Attention:異常点!!!
分布を可視化する箱ヒゲ図
最小值:Q1 - 1.5 * IQR
第一分位(Q1)
中位数(Q2)
第三分位(Q3)
最大值:Q3 + 1.5 * IQR
IQR:对应数据分布最核心的位置,这里箱体长度越长,数据离散程度越大。
离群点

3.4 確率変数(随机变量)
P(X=赤玉)
確率分布
確率とは、横軸に確率変数を、縦軸に確率変数の起こりやすさを表した分布です。
離散:確率変数
連続:確率密度関数、这种情况下求概率就是求概率密度函数的面积,用scipy可以求
推測統計と確率分布
データはとある確率分布から得られた実現値であると考え
将数据视为从某个特定的概率分布中获得的实现值。
期待値E(X)
简单说就是平均值

分散と標準偏差
就是形容数据分散程度的
歪度和尖度
- 歪度(Skewness)衡量了概率分布的偏斜程度(左右对称作为标准)。
- 如果数据更多地集中在分布的左侧,则歪度为负;
- 如果数据更多地集中在分布的右侧,则歪度为正。
- 尖度(Kurtosis)衡量了概率分布曲线的尖峰程度。
- 如果概率分布曲线具有较高的尖峰,尖度将是正的;
- 如果概率分布曲线相对平坦,则尖度将是负的。
二つの確率変数を考える(联合概率分布)
独立
非独立
条件付き確率(条件概率)
3.5 理論的な確率分布
確率分布とパラメータ
就是模型和参数
正規分布
正态分布
- 平均を中心とした、左右対称の分布である
- 自然界分布基本都是正态
標準化(0,1)
ch4 推測統計〜信頼区間
4.1 全数調査と標本調査
データを得る方法について
母集団から一部を抽出する
確率分布と実現値
データから、その発生元である確率分布を推測する
就是从数据倒退模型
母集団分布のモデル化
無作為抽出(Random Sampling)
打乱数据再抽,不然肯定有偏差啊
無作為抽出の方法
- 単純無作為抽出法
- 層化多段抽出法
データの取り方
推測統計を直感的に理解する
- 本当に興味があるのは母集団です
- 小さいサンプルサイズの標本から」母集団を推測できる
- 標本を抽出する頭巾は、Random Sampling
4.2 信頼区間
母集団とデータの間の誤差を考える
- 求全部平均成本高
- 所以先抽样
- 从样本数据建模
- 根据模型推全体状况
標本誤差
样本退出来的平均,和真正的全数据平均的偏差就是标本误差
サイコロにおける標本誤差
六个面平均 ,和你摇骰子六次的平均就是标本误差。
大数の法則
样本量足够大时,标本误差接近0
標本誤差の確率分布を知る
標本誤差の確率分布がわかれば、どの程度の大きさの誤差が、どの程度の確率で現れるかを知ることができる。
中心極限(きょくげん)定理
当样本量足够大时,他们的平均值会服从正态分布
推定量
性质:
- 不偏性
- 一致性
- 有効性
举个栗子:
求全城人平均身高
先抽样,每组20人,抽10组
得到10组的平均值
再求这10组平均值的平均值,X
- 如果,X = 总体平均值,叫不偏性
如果,任意两组A和B的平均值相等
- 但A组方差更小,也就是说,更集中 ,则A组的有效性比B组好
一致性:更强调过程
- 随着样本数量的增大,统计量会趋于真实值。
標本誤差の分布
下图为标准误差的分布,其实就是个正态分布

横轴是几倍的方差
倍数 概率 1 68% 2 95% 3 99%