통계

통계 에서 Julia

{other: "%{count}개의 연습 문제"}

통계 소개

"통계"는 여러 측면을 지닌 크고 복잡한 주제예요.

일부 측면은 Randomness 개념에서 다뤘는데, 이는 별개이면서도 관련 있는 주제예요.

가장 단순하게는, 통계가 반복 가능한 데이터 모음을 하나의 값으로 요약하는 방법을 다룰 수 있어요. Julia를 처음 접하는 사람은 언어에 기본으로 내장된 함수가 이렇게 적다는 사실에 놀랄 수도 있어요.

  • 숫자를 모두 더하는 sum.
  • 주어진 매개변수의 극값을 구하는 min과 max.
  • 반복 가능한 모음의 (min, max) 튜플을 구하는 extrema.
  • 모든 값의 개수를 세는 length.
  • 어떤 조건을 만족하는 값만 세는 count.
julia> v = collect(1:0.2:3)
11-element Vector{Float64}:
 1.0
 1.2
 ... # display truncated
 3.0

julia> mean(v)
2.0

julia> extrema(v)
(1.0, 3.0)

julia> length(v)
11

julia> min('g', 'a', 'c')
'a': ASCII/Unicode U+0061 (category Ll: Letter, lowercase)

julia> count(isodd, 1:5)  # 1, 3, and 5 are odd
3

이렇게 제한된 함수 집합은 다른 함수들을 여러 모듈과 패키지로 옮겨 기본 Julia가 비대해지는 것을 최소화하려는 의도적인 결정이에요.

Statistics 모듈

표준 라이브러리의 일부인 Statistics는 대개 미리 설치되어 있으므로, 프로그램 맨 위에 using Statistics를 추가해 네임스페이스로 불러오기만 하면 돼요.

이 모듈에는 다음 단계의 흔한 함수들이 들어 있는데, 일부 프로그래머에게 널리 쓰일 만한 것들이에요.

Statistics의 많은 함수는 이 주제에 대한 어느 정도의 배경 지식을 전제로 해요. 가장 단순한 예로는 다음이 있어요.

  • 많은 사람이 평균이라고 부르는 mean (sum / length와 같은 결과예요).
  • 정렬한 뒤의 가운뎃값인 median.
  • 값이 얼마나 넓게 퍼져 있는지를 나타내는 척도인 표준 편차를 구하는 std.
  • 분산을 구하는 var: std의 제곱으로, 보통 계산이 더 빨라요.

각 함수는 보통 여러 옵션을 가지고 있고, 훨씬 더 많은 함수가 있으니 관심 있다면 문서를 확인해 봐요.

다른 패키지들

짐작하겠지만, 통계는 Julia의 큰 활용 분야이고, 더 전문적인 작업을 지원하는 패키지도 많이 있어요.

JuliaStats 그룹이 친절하게 온라인 목록을 관리하고 있어요.

GitHub에서 편집 링크가 새 창이나 탭에서 열려요