전체 글 151

[CORNELL CS4780 Machine Learning for Intelligent Systems - Kilian Weinberger] Transformer & Bert 정리

Transformer1. Sequence Modeling과 RNN의 한계Sequence Modeling은 순서가 있는 데이터를 다루는 문제이다. 대표적으로 문장, 음성, 시계열 등이 여기에 해당한다. 먼저 RNN 계열이 이런 sequential data를 어떻게 다뤄왔는지 보여준다. 입력과 출력의 형태는 one-to-one, many-to-one, many-to-many 등 다양할 수 있다.하지만 RNN, LSTM, GRU에는 분명한 한계가 있다.첫째, 학습 속도가 느리다.둘째, 입력을 반드시 순차적으로 처리해야 한다. 현재 시점의 계산을 하려면 이전 hidden state가 먼저 필요하기 때문이다.셋째, 이런 구조 때문에 GPU를 활용한 병렬 연산이 어렵다.넷째, sequence 길이가 매우 길어질수록..

Math/Math for ML 2026.03.05

[CORNELL CS4780 Machine Learning for Intelligent Systems - Kilian Weinberger] RNN / LSTM / GRU 정리

Recurrent Neural Networks: 직관에서 Vanilla RNN, BPTT, (Exploding/Vanishing) Gradient, LSTM, GRU까지1. Sequence를 왜 따로 모델링해야 하는가연속된 관측만 보고 다음 상태를 예측하는 문제가 존재한다. 공(ball)의 “현재 스냅샷 1장”만 있으면 진행 방향을 추정하기 어렵지만, 여러 스냅샷을 연속으로 기록하면 다음 위치를 추정할 정보가 충분해진다는 직관이 출발점이다.이런 sequence는 자연어(Text), 오디오, 생체 신호(Vital sign)처럼 다양한 도메인에서 나타난다.2. Sequence Modeling Problem: “다음 단어 예측”으로 보는 난점대표 예시가 “Predict the Next Word” 문제이다. 주..

Math/Math for ML 2026.03.04

[CORNELL CS4780 Machine Learning for Intelligent Systems - Kilian Weinberger] 37강 정리

Deep Networks → Residual Networks → Stochastic Depth → CNNs1. Deep Neural Networks에서 “너무 깊게” 만들면 생기는 문제Deep Neural Networks를 “very very deep”하게 만들면, 직관적으로는 layer가 많아질수록 표현력이 커져 성능이 좋아질 것처럼 보인다. 그러나 실제로는 깊어질수록 학습 과정에서 예측이 이상하게 흔들리거나(학습 중에는 그럴듯해 보이는데) 최종 결과가 망가지는 상황이 발생한다.이 현상을 “bad layers”라는 관점으로 설명한다.layer 수가 많을수록 bad layers가 생길 확률이 커진다그리고 이 bad layers는 training 중에 detect하기 어렵다결과적으로 “깊게 쌓았다는 사실 ..

Math/Math for ML 2026.02.09

[CORNELL CS4780 Machine Learning for Intelligent Systems - Kilian Weinberger] 35~36강 정리

Perceptron → Neural Network (Forward Computation / ERM / Back Propagation) → SGD → Subgradient → Universal Approximators → Why Deeper Networks → Regularization (Dropout / Batch Normalization) 1. PerceptronAssumptionBinary classification을 가정한다. 즉, $\mathcal{Y}={-1,+1}$이다.Data가 linearly separable하다고 가정한다. 즉, 어떤 linear hyperplane이 두 클래스를 분리한다.Hypothesis class와 classifierHypothesis class는 다음과 같이 둔다...

Math/Math for ML 2026.02.09

[CORNELL CS4780 Machine Learning for Intelligent Systems - Kilian Weinberger] 26~34강 정리

Multivariate Gaussian Distribution → Gaussian Process Regression → Bagging / Random Forest → Boosting1. Multivariate Gaussian Distribution1.1 Definition$d$-dimensional random variable $X$가 Multivariate Gaussian을 따른다는 것은 다음과 같이 쓴다.$$X \sim \mathcal{N}(\mu, \Sigma)$$여기서 $\mu$는 mean, $\Sigma$는 covariance matrix이다.1.2 Probability density functionMultivariate Gaussian의 probability density function(pd..

Math/Math for ML 2026.02.02