Jay's <Devlog />Jay's Devlog
HomeBlogAbout
Login

© 2026 Jay's <Devlog />. All Rights Reserved.

GitHubLinkedIn
Gravatar
  1. Home
  2. Blog
  3. AI
  4. 01. Random Variable — 확률변수란 무엇인가?
01. Random Variable — 확률변수란 무엇인가?
AI기초 수학 33 min read

01. Random Variable — 확률변수란 무엇인가?

jay

jay

2026년 9월 30일 23:23

목차

  • 확률 실험과 표본공간
  • Random Variable이란?
  • 동전 던지기로 이해하기
  • 왜 굳이 함수로 정의할까?
  • 같은 실험에서도 다른 Random Variable을 정의할 수 있다
    • 주사위 눈 자체에 관심이 있는 경우
    • 짝수인지 아닌지만 관심이 있는 경우
  • Random Variable의 값은 왜 Random한가?
  • 대문자 X와 소문자 x의 차이
  • Discrete Random Variable과 Continuous Random Variable
    • Discrete Random Variable
    • Continuous Random Variable
  • Random Variable과 Probability Distribution의 관계
  • 머신러닝에서는 Random Variable을 어떻게 볼 수 있을까?
  • 조금 더 엄밀하게 보면
  • 정리

확률과 통계를 공부하다 보면 가장 먼저 등장하는 핵심 개념 중 하나가 Random Variable, 확률변수이다.

이름만 보면 ‘무작위로 변하는 변수’처럼 느껴지지만, 수학적으로 확률변수는 단순한 숫자가 아니라 확률 실험의 결과를 숫자로 대응시키는 함수(Function)이다.

Expectation, Variance, Probability Distribution 같은 이후의 개념들은 모두 확률변수를 대상으로 정의된다. 따라서 확률변수가 정확히 무엇인지 이해하는 것이 확률·통계 공부의 출발점이라고 볼 수 있다.

확률 실험과 표본공간

확률변수를 이해하려면 먼저 확률 실험(Random Experiment)과 표본공간(Sample Space)을 알아야 한다.

확률 실험은 실행하기 전에는 결과를 확실하게 알 수 없는 실험을 의미한다. 동전을 던지거나 주사위를 던지는 것이 대표적인 예이다.

그리고 하나의 확률 실험에서 나올 수 있는 모든 가능한 결과의 집합을 표본공간이라고 하며, 일반적으로 다음 기호로 표현한다.

Ω\Omega

예를 들어 동전을 한 번 던진다고 하면 가능한 결과는 앞면과 뒷면 두 가지이다.

Ω={H,T}\Omega=\{H,T\}

주사위를 한 번 던지는 실험이라면 표본공간은 다음과 같다.

Ω={1,2,3,4,5,6}\Omega=\{1,2,3,4,5,6\}

표본공간의 개별 결과는 보통 소문자 그리스 문자 ω(omega)로 나타낸다.

Random Variable이란?

확률변수는 표본공간의 각 결과를 실수 값으로 대응시키는 함수이다.

X:Ω→ℝX:\Omega\rightarrow\mathbb{R}

여기서 Ω는 가능한 모든 실험 결과의 집합이고, ℝ은 실수의 집합이다.

즉 어떤 결과 ω가 발생하면 확률변수 X는 그 결과를 하나의 숫자 X(ω)로 변환한다.

Random Variable은 랜덤하게 변하는 함수가 아니라, 랜덤한 실험 결과를 숫자로 표현하기 위해 미리 정의해 둔 함수이다.

한 번 X를 정의하면 같은 ω에 대해서는 항상 같은 값을 반환한다. 랜덤한 부분은 함수 X 자체가 아니라 어떤 ω가 실제로 발생하는가에 있다.

동전 던지기로 이해하기

공정한 동전을 한 번 던지는 상황을 생각해보자.

Ω={H,T}\Omega=\{H,T\}

앞면과 뒷면은 문자이기 때문에 그대로는 평균이나 분산과 같은 수치 계산을 하기 어렵다.

그래서 다음과 같은 확률변수 X를 정의할 수 있다.

X(H)=1,X(T)=0X(H)=1,\qquad X(T)=0

이 확률변수는 앞면이 나오면 1, 뒷면이 나오면 0이라는 숫자를 부여한다.

실험 결과 ω확률변수의 값 X(ω)
H1
T0

이제 앞면과 뒷면이라는 실험 결과를 0과 1이라는 숫자로 표현할 수 있게 되었고, 이를 이용해 기대값이나 분산 같은 수학적 연산을 정의할 수 있다.

왜 굳이 함수로 정의할까?

확률변수를 함수로 정의하는 중요한 이유는 현실의 사건과 수학적 계산을 연결하기 위해서이다.

현실의 결과는 반드시 숫자의 형태일 필요가 없다. 동전의 앞면과 뒷면처럼 문자일 수도 있고, 어떤 제품의 불량 여부나 사람의 상태처럼 범주형 결과일 수도 있다.

확률변수를 사용하면 이러한 결과를 분석 목적에 맞는 숫자로 표현할 수 있다.

현실의 확률적 결과 → Random Variable → 계산 가능한 숫자

숫자로 변환한 뒤에는 평균, 분산, 공분산, 확률분포 등 다양한 수학적 도구를 사용할 수 있다.

같은 실험에서도 다른 Random Variable을 정의할 수 있다

확률변수에서 중요한 점은 하나의 확률 실험에 하나의 확률변수만 존재하는 것이 아니라는 점이다.

주사위를 한 번 던지는 실험을 생각해보자.

Ω={1,2,3,4,5,6}\Omega=\{1,2,3,4,5,6\}

주사위 눈 자체에 관심이 있는 경우

가장 단순하게는 주사위의 눈 자체를 값으로 사용하는 확률변수 X를 정의할 수 있다.

X(ω)=ωX(\omega)=\omega

주사위에서 4가 나오면 X=4가 된다.

짝수인지 아닌지만 관심이 있는 경우

반대로 정확한 주사위 눈은 중요하지 않고 짝수가 나왔는지만 알고 싶다면 다른 확률변수 Y를 정의할 수 있다.

Y(ω)={1,ω가 짝수인 경우0,ω가 홀수인 경우Y(\omega)=\begin{cases}1,&\omega\text{가 짝수인 경우}\\0,&\omega\text{가 홀수인 경우}\end{cases}

같은 주사위 실험을 사용했지만 X는 주사위 눈 자체를 나타내고, Y는 짝수 여부만 나타낸다.

Random Variable은 우리가 어떤 정보를 숫자로 표현하고 싶은지에 따라 정의된다.

Random Variable의 값은 왜 Random한가?

확률변수 X는 미리 정의된 함수이므로 X 자체가 매번 무작위로 바뀌는 것은 아니다.

무작위성은 어떤 실험 결과 ω가 발생할지 사전에 알 수 없다는 데서 발생한다.

동전 예제에서 X(H)=1, X(T)=0이라는 규칙은 항상 동일하다. 하지만 실제 동전을 던지기 전에는 H와 T 중 무엇이 나올지 모르기 때문에 X의 최종 값도 미리 알 수 없다.

즉 다음과 같은 구조로 이해할 수 있다.

ω가 랜덤하게 결정됨 → X는 정해진 규칙으로 ω를 변환함 → 결과적으로 X의 값이 랜덤하게 관찰됨

대문자 X와 소문자 x의 차이

확률과 통계에서는 대문자 X와 소문자 x를 구분해서 사용하는 경우가 많다.

  • X: Random Variable 자체
  • x: Random Variable이 실제로 취한 특정 값

예를 들어 X가 ‘주사위를 던졌을 때 나오는 눈’을 의미한다고 하자.

주사위를 실제로 던졌을 때 4가 나왔다면 관측된 값은 x=4이다.

따라서 다음 표현은 ‘확률변수 X가 값 4를 가질 확률’이라는 의미이다.

P(X=4)P(X=4)

처음 확률을 공부할 때 X와 x를 같은 것으로 생각하기 쉽지만, 확률변수와 그 확률변수가 실제로 취한 값을 구분하는 것이 중요하다.

Discrete Random Variable과 Continuous Random Variable

확률변수는 어떤 값을 가질 수 있는지에 따라 대표적으로 이산 확률변수(Discrete Random Variable)와 연속 확률변수(Continuous Random Variable)로 구분한다.

Discrete Random Variable

가능한 값을 셀 수 있는 확률변수이다.

  • 주사위의 눈
  • 동전을 10번 던졌을 때 앞면이 나온 횟수
  • 하루 동안 발생한 서버 장애 횟수
  • 구매 여부를 0과 1로 표현한 변수

예를 들어 동전을 10번 던졌을 때 앞면이 나온 횟수 X는 다음 값 중 하나를 가진다.

X∈{0,1,2,…,10}X\in\{0,1,2,\ldots,10\}

Continuous Random Variable

연속적인 범위의 값을 가질 수 있는 확률변수이다.

  • 사람의 키
  • 온도
  • 센서의 측정값
  • 어떤 작업을 완료하는 데 걸리는 시간
  • 금융자산의 수익률을 연속형 모델로 표현한 경우

이산 확률변수와 연속 확률변수는 확률을 표현하는 방식에서도 차이가 있다. 이 부분은 이후 PMF, PDF, CDF를 다룰 때 자세히 살펴본다.

Random Variable과 Probability Distribution의 관계

확률변수를 정의하면 자연스럽게 다음 질문을 할 수 있다.

“이 확률변수는 각각의 값을 어느 정도의 확률로 가지는가?”

이 질문에 답하는 것이 Probability Distribution, 확률분포이다.

동전 예제에서 X(H)=1, X(T)=0이라고 정의하고 동전이 공정하다면 다음과 같다.

P(X=1)=12,P(X=0)=12P(X=1)=\frac{1}{2},\qquad P(X=0)=\frac{1}{2}

확률변수 X가 어떤 값을 가질지에 대한 확률적 규칙이 X의 확률분포를 구성한다.

따라서 전체 흐름은 다음처럼 생각할 수 있다.

Random Experiment → Sample Space → Random Variable → Probability Distribution

머신러닝에서는 Random Variable을 어떻게 볼 수 있을까?

머신러닝에서도 확률변수는 기본적인 표현으로 사용된다.

예를 들어 분류 문제에서 입력 데이터를 X, 정답 label을 Y라는 확률변수로 표현할 수 있다.

X=Input Features,Y=LabelX=\text{Input Features},\qquad Y=\text{Label}

예를 들어 신용위험 분류에서 Y를 고객의 부도 여부라고 정의하면 다음처럼 표현할 수 있다.

Y={1,Default0,Non-defaultY=\begin{cases}1,&\text{Default}\\0,&\text{Non-default}\end{cases}

입력 X가 주어졌을 때 Y가 1일 가능성을 모델링하면 다음과 같은 조건부확률을 다루게 된다.

P(Y=1|X)P(Y=1\mid X)

이처럼 확률변수라는 개념은 이후 확률분포, 조건부확률, 통계적 추정, 머신러닝 모델을 표현하는 기본 언어로 계속 사용된다.

조금 더 엄밀하게 보면

기초 단계에서는 확률변수를 “표본공간에서 실수로 가는 함수”라고 이해해도 충분하다.

다만 엄밀한 확률론에서는 임의의 함수가 모두 Random Variable이 되는 것은 아니다. 확률을 올바르게 정의할 수 있도록 특정 조건을 만족하는 measurable function이어야 한다.

이 조건은 Measure Theory를 공부할 때 중요하게 다루며, 현재 단계에서는 “Random Variable은 확률 실험의 결과를 수치화하는 함수”라는 핵심 개념을 이해하는 것이 우선이다.

정리

Random Variable에서 우선 기억해야 할 내용은 다음과 같다.

  • Random Variable은 확률 실험의 결과를 숫자로 대응시키는 함수이다.
  • 수학적으로는 X: Ω → ℝ 형태로 표현한다.
  • 랜덤한 것은 함수 X 자체가 아니라 어떤 실험 결과 ω가 발생하는지이다.
  • 하나의 표본공간에서도 목적에 따라 여러 확률변수를 정의할 수 있다.
  • 대문자 X는 확률변수, 소문자 x는 확률변수가 실제로 취한 값을 의미하는 경우가 많다.
  • 확률변수는 크게 이산 확률변수와 연속 확률변수로 구분할 수 있다.
  • 확률변수가 어떤 값을 어떤 확률로 가지는지를 설명하는 것이 Probability Distribution이다.

Random Variable을 이해했다면 다음 단계에서는 확률변수의 분포를 실제로 어떻게 표현하는지 살펴볼 수 있다.

다음 글에서는 PMF, PDF, CDF가 각각 무엇이고 서로 어떻게 다른지를 정리한다.

#AI Mathematics#Probability#Probability Distribution#Random Variable#Sample Space#확률론#확률변수

You might also like

ISRF 논문 정리: LLM 추천 시스템에서 개인 관심사와 그룹 잠재 관심사를 함께 추론하는 방법

#Collaborative Filtering#Contrastive Learning#DeepSeek

큰 배치는 왜 일반화가 나빠질까? Sharp Minima와 Mini-batch Noise 정리

#Batch Size#Flat Minima#Generalization Gap

[Xavier 초기화] 깊은 신경망은 왜 학습되지 않았을까?

#Sigmoid#Vanishing Gradient#Xavier 초기화

Comments (0)

Leave a Reply

Or login to comment with your account.

No comments yet. Be the first to share your thoughts!