이상치 검정

반복 측정값 중 가장 극단적인 값을 검정해 통계량·임계값·p 값을 봅니다.극단적인 값 하나를 Grubbs 또는 Dixon Q 로 검정합니다.

한 줄에 하나씩, 또는 스프레드시트의 한 열을 붙여넣으십시오.

방향에 상관없이 평균에서 가장 먼 값을 검정합니다.

이 정도로 극단적인 값이 우연만으로 걸릴 비율입니다.

이 검정이 쓰는 식

검정통계량
검정통계량 — Grubbs — 양쪽 끝G=max |xi|s
임계값
임계값 — Grubbs — 양쪽 끝Gcrit=(n − 1)n·t2α/2n, n−2n − 2 + t2α/2n, n−2

x̄ 는 평균, s 는 표본표준편차(n−1)입니다. t 는 자유도 n−2 인 t 분포에서 위쪽 꼬리 넓이가 α/2n 이 되는 값입니다.

사용 방법

  1. 어떤 검정을 어떤 유의수준으로 쓸지 정해 계획서에 적으십시오 — 숫자를 보기 «전»에.
  2. 반복 측정값을 한 줄에 하나씩 붙여넣습니다.
  3. 검정을 고릅니다. Grubbs 는 개수 제한이 없고, Dixon Q 는 3~10개용입니다.
  4. 검정통계량을 임계값과 견줍니다. p 값이 있는 경우, 그 통계량이 얼마나 드문지를 말해 줍니다.

💡 지수는 e를 사용해 입력할 수 있습니다. 예를 들어 1.5×10⁻⁵ 은 1.5e-5 로 입력하면 계산됩니다.

공식과 주의사항

두 검정 모두 극단적인 값 하나를 나머지의 퍼짐과 견주며, 나머지가 대략 정규분포라고 가정합니다.

Grubbs

평균에서 몇 표준편차 떨어져 있는지입니다. 임계값이 t 분포에서 나오므로 인쇄된 표를 읽는 대신 어떤 개수·어떤 유의수준에서도 정확합니다.

양측
G = max|xi − x̄| / s
최소
G = (x̄ − xmin) / s
최대
G = (xmax − x̄) / s

Dixon Q

의심되는 값과 그 이웃 사이의 틈을 전체 범위로 나눕니다. 임계값을 출판된 표에서 읽기 때문에 개수에 제한이 있고 p 값이 없습니다.

Q = 틈 / 범위

주의사항

  • 검정 결과는 데이터를 지워도 된다는 허가가 아닙니다. 배제 규칙은 실험 «전»에 정해 두고, 한 번만 적용하고, 어느 쪽이든 무엇을 했는지 보고하십시오.
  • 이상치가 곧 발견인 경우가 많습니다. 오염된 웰과 진짜 효과는 같은 모양의 숫자를 냅니다 — 어느 쪽인지는 실험대만 압니다.
  • 두 검정 모두 «의심되는 값 하나»를 위한 것입니다. 같은 자료에 반복해서 돌리거나, 하나를 빼고 다시 돌리면 실제 오류율이 고른 유의수준보다 훨씬 커집니다.
  • 둘 다 나머지가 대략 정규분포라고 가정합니다. 크게 치우친 자료에서는 이상한 값이 아니라 그냥 꼬리를 집어냅니다.

자주 묻는 질문

함께 많이 쓰는 도구