본문 바로가기

전체 글

(21)
[패턴인식]Chapter 9.1-3 Algorithm-Independent Machine Learning (김경환 교수님의 자료와 수업을 통해 제작되었습니다.) 9.1 Introduction 이전 장까지를 통해 여러 classfier를 살펴보았다. 이 과정에서 어떠한 장점을 갖고, 단점을 갖는지 살펴보았다. 이번 장에서는 여러 문제에 대해 일반적으로 좋은 classifer가 존재하는 지에 대해 문제를 다룬다. 이 책에서는 classfier는 각 문제마다 다른 접근을 이용해야 하며, 일반적으로 모든 문제에 대해 좋은 classfier는 존재하지 않는다고 말한다. 따라서 주어진 문제에 대한 충분한 이해가 필요하며, 그에 맞는 model의 설계가 필요하다. model을 설계하는 것에 있어서는 각 model의 장단점을 확실히 알고 있어야 하며, 문제에 대한 깊은 이해가 필요할 것이다. 9.2 Lack of inhe..
[패턴인식]Chapter 7.5 Evolutionary methods (김경환 교수님의 자료와 수업을 통해 제작되었습니다.) 7.5 Evolutionary methods 생물학적으로 진화하는 과정을 본따 classifer를 설계한다. 세대가 지날수록 생존에 유리한 형질을 갖고 있는 것들이 살아남게 된다. 부모가 자식을 낳는 과정에서 부모가 갖는 형질의 복사, crossover는 랜덤하게 이뤄지게 되며, Mutation, 변이가 생기기도 한다. 이 과정을 학습에 이용하게 되고, 높은 점수를 갖는 형질들이 높은 확률로 살아남게 되어 최종적으로 원하고자 하는 값을 얻을 수 있게 된다. replication은 염색체가 재생산되고, 바뀌지 않는다는 것을 말하고, crossover는 두 염색체가 교배하여 나타나는 과정에서염색체 A와 B가 교배한다면, A의 앞, B의 뒤부분이 자식으로..
[패턴인식]Chapter 7.1-2 Stochastic Methods (김경환 교수님의 자료와 수업을 통해 제작되었습니다.) 7.1 Introduction low dimension에 대한 학습은 손으로 계산하거나, 접근이 쉽다. dimension이 높아질수록 손으로 계산하기가 어려워지고, 복잡해져 gradient descent로 solution region에 점점 다가가게 된다. 접근하는 방향에 있어서 랜덤성을 수용하는 것은 학습에 도움이 되고, 복잡한 모델이더라도 좋은 parameter를 갖도록 도와준다. 이에 따라 두가지 해결 방법을 제시하는데, 첫 번째는 Boltzmann learning이고, 두 번째는 genetic algoritms이다. 이 장에서는 첫 번째의 방법에 집중하도록 한다. 이 방법은 grdient 방법으로 설명될 수 있는 점도 있지만, 복잡한 prob..
[패턴인식]Chapter 6.8 Practical techniques for improving backpropagation (김경환 교수님의 자료와 수업을 통해 제작되었습니다.) 6.8 Practical techniques for improving backpropagation BP를 위한 실질적인 기법을 소개한다. [Activation function] network의 각 노드들에 대해서 weigted sum을 취하고, 각 노드들에 대해 activation function을 거쳐 노드의 출력으로 나타난다. 우선 f가 만족해야 하는 점은 1) non-linear해야 한다는 점이다. linear하다면 여러 layer로 구성된 network가 하나의 layer로 구성된 것과 같은 동작을 하게 될 것이다. 2) saturation되어야 한다. 즉, 최대와 최소값을 가져야 한다. 이는 weight와 activation을 일정 값 내로..
[패턴인식]Chapter 6.4-6 Error Surfaces & Backpropagation as feature map (김경환 교수님의 자료와 수업을 통해 제작되었습니다.) 6.4 Error surfaces 이전 장에서 다룬 BP는 gradient descent에 기반하기 때문에, error surface 자체를 탐구하여 알고리즘에 대한 이해와 직관을 얻을 수 있다고 한다. 또한, gradient descent를 진행하며 발생하는 오류, global minimum과 local minima. 목표는 global minimum을 찾는 것이 목적이 되겠지만 그 값까지 찾아가는 경로에서 gradient=0이 발생하는 경우 어떻게 다뤄야 하는 것인지에 대해 다뤄본다. 위 경우는 점 하나로 각 클래스를 구분할 수 있는 linearly separable한 경우이다. w가 -1과 1사이에 존재한다면 간단한 neural network ..
[패턴인식]Chapter 6.1~3 Multilayer Neural Networks (김경환 교수님의 자료와 수업을 통해 제작되었습니다.) 6.1 Introduction 이전 장에서는 linearly separable한 경우에 대한 부분을 다뤘다. linearly separable하지 않은 경우에는 LMS와 같은 방법에서 gradient descent 방법을 이용하고자 하였고, linearly separable하도록 phi function을 정해주었다. 우리가 찾고자 하는 것은 linearly separable하게 나눌 수 있는 hyperplane을 찾고자 하는 것이 목표였고, linear discriminant와 동시에 학습하고자 한다. 이에 다층 신경망, multilayer neural network 또는 다층 퍼셉트론의 방식이 도입된다. neural network는 LMS 알고리즘..
[패턴인식]Chapter 5.7~8 Nonseparable behavior (김경환 교수님의 자료와 수업을 통해 제작되었습니다.) 5.7 Nonseparable behavior 우리는 이전장 까지 linearly separable한 것을 가정하고 문제에 접근했다. 하지만, 실제로는 그렇지 않은 경우가 더 많을 것이다. 이에 우리는 최적의 해답을 찾고자 할 것이다. 이러한 문제에서 $\eta(k)$는 더 중요해진다. 여러가지 방법이 있다고 앞서 말했지만, 여기서는 크게 두 가지에 대해 언급한다. 1) clasifier의 성능이 좋아질수록 $\eta(k)$를 감소시키는 것이다. 2) $\eta(k)=\eta(1)/k$를 택하는 것이다. 위 두 접근에서 $\eta(k)가 0에 접근해야 하는 점은 동일하고, 이 감소하는 정도가 너무 빠르면 weight vector는 최적의 상태가 아닌..
[패턴인식]Chapter 5.6 Relaxation Procedures (김경환 교수님의 자료와 수업을 통해 제작되었습니다.) 5.6 Relaxation Procedures 앞장에서 정의한 J, criterion function은 유일하지 않고, 이에 다른 J에 대해서도 살펴보고자 한다. 여기서도 missclassified된 샘플에 대해서 계산을 진행한다. 5.5장에서 다룬 함수는 기울기가 불연속적이었던 반면, 위 식은 기울기가 연속적이며, 탐색함에 있어서 부드러운 표면을 사용할 수 있다. 하지만 여기서도 두 가지 문제점이 존재한다. 1) a=0이 되는 경우, 2) 샘플의 길이가 긴 벡터들에 의한 영향이 클 수 있다.(제곱을 취해주기 때문) 이 두 문제를 한번에 해결할 수 있는 함수는 다음과 같다. 분자를 통해서 a가 0이 되는 것을 방지할 수 있고, 분모를 통해 샘플 벡터..