○ 선형 회귀 방식을 분류에 적용한 알고리즘

○ 로지스틱 회귀가 선형 회귀와 다른점은 선형 함수의 회귀 최적선을 찾는 것이 아니라, 시그모이드 함수의 최적선을 찾고 이 시그모이드 함수의 반환 값을 확률로 간주해 확률에 따라 분류를 결정함

○ 주로 이진분류에 사용(다중 클래스 분류에도 적용가능:ovr, ovo, mulitinomial(softmax))

○ 로지스틱 회귀에서 예측값은 예측확률을 의미하고 0.5 이상은 1, 0.5 이하이면 0으로 예측

 

시그모이드(Sigmoid) 함수 이해

- 시그모이드 함수는 x값이 +, -로 아무리 커지거나 작아져도 y값은 항상 0과 1사이 값을 반환

- 즉, x값이 커지면 1에 근사하며 x값이 작아지면 0에 근사함. 그리고 x가 0일 때는 0.5

 

로지스틱 회귀분석 원리

1. 단순 선형 회귀 y = w1x+w0

○ 로지스틱 회귀는 0과 1을 예측하고, 단순 회귀식은 -∞~∞ 사이의 값을 예측하기 때문에 단순 회귀식에 적용할 수 없음

→ 일반적인 선형 회귀로는 값을 바로 추정할 수 없음

○ but, Odds(성공확률/실패확률)을 통해 선형 회귀식에 확률을 적용할 수 있음

  • 오즈(Odds) 란?

사건이 발생(성공)할 확률을 발생하지 않을(실패) 확률로 나눈 값

→ 성공할 확률이 실패할 확률의 몇 배인지 나타내는 값

Odds(p) = p / (1-p)
(p:성공확률 / 1-p:실패확률)

2. but, 확률 p의 범위가 [0,1]이고, 선형 회귀의 반환값인 [-∞,∞]에 대응하기 위해서 로그변환을 수행하고 이 값에 대한 선형회귀를 적용함

Log(Odds(p)) = w1x+w0

3. 해당 식을 데이터 값 x의 확률 p로 정리하면 아래와 같음

○ 로지스틱 회귀는 학습을 통해 시그모이드 함수의 w를 최적화하여 예측


 

Reference)

https://blog.naver.com/lingua/222710952075

+ Recent posts