
02. PMF, PDF, CDF — 확률분포를 표현하는 세 가지 방법
jay
2026년 10월 5일 13:42
목차
앞선 글에서는 Random Variable, 확률변수가 확률 실험의 결과를 숫자로 대응시키는 함수라는 점을 살펴봤다.
확률변수 X를 정의했다면 자연스럽게 다음 질문이 생긴다.
확률변수 X가 각각의 값을 가질 가능성은 어떻게 표현할까?
이때 등장하는 개념이 PMF, PDF, CDF이다.
세 개념은 모두 확률변수의 분포를 표현하지만, 사용되는 상황과 의미가 서로 다르다.
- PMF: 이산 확률변수가 특정 값을 가질 확률
- PDF: 연속 확률변수의 확률이 어디에 얼마나 밀집되어 있는지를 나타내는 밀도
- CDF: 확률변수가 특정 값 이하일 누적 확률
특히 PDF를 처음 공부할 때 PDF의 높이 자체가 확률이라고 생각하는 것이 가장 흔한 혼동 중 하나다. 이번 글에서는 이 부분을 중심으로 각각의 차이를 정리한다.
확률분포란 무엇인가?
확률분포(Probability Distribution)는 확률변수 X가 어떤 값을 어떤 가능성으로 가지는지를 나타낸다.
예를 들어 공정한 주사위를 한 번 던지고, 나온 눈을 확률변수 X라고 하자.
공정한 주사위라면 각각의 값이 나올 확률은 모두 같다.
이처럼 확률변수의 가능한 값과 그 값에 대응하는 확률을 나타내는 방식이 확률분포이다.
다만 확률변수가 이산형인지 연속형인지에 따라 확률을 표현하는 방법이 달라진다.
PMF: Probability Mass Function
PMF(Probability Mass Function)는 이산 확률변수의 확률분포를 표현하는 함수이다.
확률변수 X가 특정 값 x를 가질 확률을 직접 나타낸다.
즉 PMF의 함수값 자체가 해당 값이 발생할 확률이다.
주사위 예제
공정한 주사위를 한 번 던졌을 때 나온 눈을 X라고 하면 PMF는 다음과 같다.
예를 들어 주사위에서 3이 나올 확률은 다음과 같다.
PMF에서는 특정한 하나의 값에 직접 확률을 부여할 수 있다는 점이 중요하다.
PMF가 만족해야 하는 조건
모든 확률은 0 이상이어야 한다.
그리고 X가 가질 수 있는 모든 값의 확률을 더하면 1이 되어야 한다.
PDF: Probability Density Function
PDF(Probability Density Function)는 연속 확률변수의 분포를 나타내는 함수이다.
여기서 가장 중요한 점은 PDF의 값 자체는 확률이 아니라 확률밀도(Probability Density)라는 것이다.
PMF의 높이 = 확률
PDF의 높이 ≠ 확률
연속 확률변수에서는 특정한 하나의 값이 나올 확률이 0이다.
처음 보면 이상하게 느껴질 수 있다. 예를 들어 사람의 키를 연속 확률변수로 모델링했을 때 정확히 170.000000…cm일 확률은 0이라고 표현한다.
하지만 “169cm에서 171cm 사이일 확률”처럼 구간을 사용하면 확률을 계산할 수 있다.
즉 PDF에서는 곡선 아래의 면적이 확률이 된다.

[PDF 곡선에서 a부터 b까지의 면적이 P(a ≤ X ≤ b)를 나타내는 그림]
왜 한 점의 확률은 0일까?
연속 확률변수는 셀 수 없이 많은 값을 가질 수 있다.
예를 들어 0과 1 사이에도 0.1, 0.01, 0.001뿐 아니라 무한히 많은 실수가 존재한다.
특정한 한 점의 구간 길이는 0이므로 PDF를 적분해도 면적이 0이 된다.
따라서 연속 확률변수에서는 다음 표현들이 같은 확률을 갖는다.
끝점 하나가 포함되거나 제외되어도 그 한 점의 확률이 0이기 때문이다.
PDF가 만족해야 하는 조건
확률밀도 역시 음수가 될 수 없다.
그리고 전체 영역의 면적은 1이어야 한다.
PDF의 값이 1보다 커도 될까?
PDF를 처음 볼 때 또 하나 헷갈리는 부분은 밀도의 값이 1보다 커질 수 있다는 점이다.
PDF의 값은 확률 자체가 아니기 때문에 1보다 커도 문제가 없다.
예를 들어 X가 0부터 0.5 사이에서 균일하게 분포한다고 하자.
PDF의 높이는 2이지만 전체 면적은 다음과 같다.
확률에서 중요한 것은 PDF의 개별 높이가 아니라 구간 아래의 면적이다.
CDF: Cumulative Distribution Function
CDF(Cumulative Distribution Function)는 확률변수가 특정 값 이하일 확률을 나타낸다.
이름 그대로 왼쪽에서부터 x까지의 확률을 계속 누적한 값이다.
CDF = 현재 x까지 누적된 전체 확률
CDF는 이산 확률변수와 연속 확률변수 모두에 정의할 수 있다는 점도 중요하다.
주사위의 CDF
공정한 주사위에서 X가 나온 눈을 의미한다고 하자.
예를 들어 X가 3 이하일 확률은 1, 2, 3이 나오는 확률을 모두 더하면 된다.
PMF가 각각의 값에 대한 확률을 보여준다면 CDF는 그 확률을 왼쪽부터 계속 더해 나간 형태이다.
| x | PMF: P(X=x) | CDF: P(X≤x) |
|---|---|---|
| 1 | 1/6 | 1/6 |
| 2 | 1/6 | 2/6 |
| 3 | 1/6 | 3/6 |
| 4 | 1/6 | 4/6 |
| 5 | 1/6 | 5/6 |
| 6 | 1/6 | 1 |
연속 확률변수에서 PDF와 CDF의 관계
연속 확률변수에서는 CDF를 PDF를 적분해서 구할 수 있다.
즉 PDF의 왼쪽 끝부터 x까지의 면적을 계산하면 CDF가 된다.
반대로 CDF가 미분 가능한 경우에는 CDF를 미분해서 PDF를 얻을 수 있다.
PDF를 적분하면 CDF, CDF를 미분하면 PDF
단, 이 미분 관계는 연속분포에서 CDF가 적절하게 미분 가능한 경우에 적용된다.

[동일한 연속분포에서 PDF와 CDF를 위아래로 비교한 그림]
CDF로 구간 확률 구하기
CDF를 알고 있으면 특정 구간에 들어갈 확률도 쉽게 계산할 수 있다.
연속 확률변수에서는 다음과 같이 표현할 수 있다.
b까지 누적된 확률에서 a까지 누적된 확률을 빼면 a와 b 사이의 확률만 남는다.
PMF, PDF, CDF의 차이
| 구분 | PMF | CDF | |
|---|---|---|---|
| 전체 이름 | Probability Mass Function | Probability Density Function | Cumulative Distribution Function |
| 주로 사용 | 이산 확률변수 | 연속 확률변수 | 이산·연속 모두 |
| 함수값의 의미 | 특정 값의 확률 | 확률밀도 | 특정 값 이하의 누적확률 |
| 특정 값의 확률 | P(X=x)=p(x) | P(X=x)=0 | 누적확률로 표현 |
| 확률 계산 | 확률을 더함 | 구간을 적분함 | CDF 값의 차이를 사용 |
| 전체 합/면적 | 1 | 1 | 최종적으로 1에 수렴 |
가장 헷갈리는 부분: PMF와 PDF의 차이
PMF와 PDF를 모두 그래프로 그리면 세로축에 어떤 값이 존재하기 때문에 두 값 모두 확률처럼 보일 수 있다.
하지만 의미는 명확히 다르다.
PMF
PMF에서는 하나의 점에 실제 확률이 존재한다.
PDF에서는 하나의 점의 높이는 확률이 아니다.
PDF는 그 지점 주변에 상대적으로 얼마나 많은 확률이 밀집되어 있는지를 나타내는 값이며, 실제 확률은 구간을 적분해 계산한다.
PMF는 점의 높이를 본다.
PDF는 구간 아래의 면적을 본다.
머신러닝에서는 어디에서 등장할까?
PMF, PDF, CDF는 머신러닝에서도 계속 등장한다.
분류 문제에서 클래스가 이산적인 경우에는 각 클래스의 확률을 PMF와 유사한 형태로 다룬다.
반대로 Gaussian Distribution처럼 연속적인 변수를 모델링할 때는 PDF를 사용한다.
CDF는 특정 threshold 이하에 값이 들어갈 확률을 계산하거나 quantile을 정의할 때 사용된다.
이후 Maximum Likelihood Estimation을 공부할 때도 이산분포에서는 PMF, 연속분포에서는 PDF를 이용해 관측 데이터의 likelihood를 구성하게 된다.
정리
PMF, PDF, CDF에서 가장 먼저 기억해야 할 차이는 다음과 같다.
- PMF는 이산 확률변수가 특정 값을 가질 확률을 직접 나타낸다.
- PDF는 연속 확률변수의 확률밀도를 나타내며 함수값 자체가 확률은 아니다.
- 연속 확률변수의 실제 확률은 PDF를 구간에서 적분한 면적으로 계산한다.
- 연속 확률변수에서 특정한 하나의 값을 가질 확률은 0이다.
- CDF는 X가 x 이하일 누적확률 P(X≤x)를 나타낸다.
- CDF는 이산 확률변수와 연속 확률변수 모두에 정의할 수 있다.
- 연속분포에서는 PDF를 적분하면 CDF를 얻을 수 있다.
PMF = 점의 확률
PDF = 확률의 밀도
CDF = 누적된 확률
이 개념을 이해하면 이제 확률변수가 평균적으로 어떤 값을 갖는지를 설명할 수 있다.
다음 글에서는 Expectation, 기대값이 무엇인지와 단순한 산술평균과 어떤 관계가 있는지를 정리한다.
You might also like
Comments (0)
Leave a Reply
Or login to comment with your account.
No comments yet. Be the first to share your thoughts!