목록전체 글 (41)
AI기록장
‣ 해당 블로그는 ⌜실전! 파이토치 딥러닝 프로젝트⌟를 공부하며, 배운것들을 토대로 정리되었음을 알려드립니다. 텍스트 생성이란? 인공지능이 기존의 텍스트로부터 새로운 텍스트를 생성하는 포로세스. 뉴스 기사, 시, 코드, 스크립트, 소설, 잡지 문구 등과 같이 텍스트 생성을 다루는 자연어 처리(NLP)의 한 분야라고 생각하면 좋겠다. 텍스트 생성은 작사, 기사의 주요 문구, 제목, 이메일 작성 등 창의적으로 텍스트를 생성해야하는 다양한 분야에도 널리 사용되고 있다. 생성형 AI에서의 텍스트 생성 원리 텍스트 생성은 대규모 텍스트 데이터를 미리 학습한 머신러닝 모델을 사용하여, 또 다른 새로운 텍스트를 생성하는 프로세스를 갖고 있다. 단어와 구문 사이의 통계적 관계 및 수치적 관계를 이용하여 학습하고, 학습..
‣ 해당 블로그는 ⌜실전! 파이토치 딥러닝 프로젝트⌟를 공부하며, 배운것들을 토대로 정리되었음을 알려드립니다. 언어 모델링 특정 단어 시퀀스가 주어졌을 때 그 뒤를 따를 단어 또는 단어 시쿼스의 발생 확률을 알아 내는 작업. ("French is a beautiful ___" -> 'language' 나 'word' 등이 나올 확률은? ) -> 확률적 통계적 기법을 사용하여 언어를 모델링함으로써 계산 됨. 이는 어떤 단어들이 함께 등장하고, 어떤 단어들이 절대 함께 나오지 않는지를 배움으로써 텍스트 말뭉치를 관찰하고 문법을 학습하는 것에서 비롯됐다. 트랜스포머 모델 아키텍처 위 그림에서 왼쪽은 '인코드', 오른쪽은 '디코더'에 해당하고, 아키텍처가 깊어질수록 인코더와 디코더는 여러번 이어 붙일 수 있다...
‣ 해당 블로그는 ⌜실전! 파이토치 딥러닝 프로젝트⌟를 공부하며, 배운것들을 토대로 정리되었음을 알려드립니다. 순환 신경망(RNN, recurrent neural network) X(혹은 y)가 단일의 독립 데이터 포인트뿐 아니라 데이터포인트의 시간 순서 [X1,X2..Xt] 또는 [y1,y2,,yt]인 순서를 모델링할 수 있는 종류의 신경망 X2(시간 단계 2에서 데이터 포인트)는 X1에 종속되고, X3는 X2와 X1에 종속되는 과정 → 이러한 네트워크가 순환 신경망(RNN) 이와 같이 네트워크에서 주기를 생성하는 모델에 추가적인 가중치를 포함해 데이터의 시간적 측면을 모델링 할 수 있음. 신경망 데이터 셋의입력(X)과 출력(Y) 사이의 복잡한 패턴을 학습하는 데 사용되는 강력한 머신러닝 도구 주기(C..
논문 선정 이유 U-Net의 구조가 작은 부품에 대해서 일괄적으로 'Image Segmentation'을 진행하여 이를 양품을 판별해 내는 과정에 유용하게 사용 될 수 있을 것이라는 생각 적은 학습 데이터를 가지고 'Data Augmentation'을 활용하여 좋은 성능을 낼 수 있는 구조에 대한 호기심 Semantic Segmantation 정의 : 이미지 내에 있는 물체(Object)들의 의미 있는 (Semantic)단위로 분활(Segmentation)하는 작업을 의미 일반적인 분류(Classification) 에서는 단일 이미지를 하나의 클래스로 분류했었다. 분할(Segmentation) 에서는 각 픽셀마다 하나의 클래스로 분류한다. Figure : 이미지에 존재하는 각각의 픽셀마다 Class la..
앙상블 학습(Ensemble Learning) 앙상블 학습이란? 앙상블 학습(Ensemble Learning)을 통한 분류는 여러 개의 분류기(Classifier)를 생성하고, 그 예측을 결합함으로써 보다 정확한 최종 예측을 도출하는 기법임 어려운 문제의 결론을 내기 위해 여러 명의 전문가로 위원회를 구성해 다양한 의견을 수렴하고 결정하듯이 앙상블 학습의 목표는 다양한 분류기의 예측 결과를 결합함으로써 단일 분류기보다 신뢰성이 높은 예측값을 얻는 것이다. 앙상블 유형 일반적으로 보팅(Voting), 배깅(Bagging), 부스팅(Boosting)으로 구분할 수 있으며, 이외에 스태킹(Stacking)등의 기법이 있다. 대표적 배깅은 랜덤포레스트 알고리즘이 있으며, 부스팅은 에이다 부스팅, 그래디언트 부스..
결정 트리(Decision Tree) 머신러닝의 기본적인 알고리즘으로, 분류(Classification)과 회귀(Regression) 두 종류 모두 사용되는 지도학습 알고리즘. 기본적인 구조는 '예/아니요'의 방식으로 알고리즘이 전개되는데, 데이터를 다루는 목적에 따른 기준을 형성하고, 이 기준을 토대로 트리를 형성하게 된다. 앞선 기준에 따라 성능이 달라지게 된다. 트리 분기 방식 우선, 결정 트리의 알고리즘은 지니 불순도(Gini)와 엔트로피(Entropy)를 사용하여 분기하는 방식 지니 불순도(Gini) 집합에 있어, 이질적인 것이 얼마나 섞여 있는지 측적하는 지표이며, CART 알고리즘에서 사용 쉽게 말해서, 어떤 집합에서 한 항목을 뽑아 무작위로 라벨을 추정할 떄 틀릴 확률을 말함..
Machine Learning Evaluation 성능 평가 → 모델링을 할 수 있는 ML 알고리즘을 만들었다면, 실제값과 모델에 의해 예측된 값을 비교하여 두 오차를 구하는 것이다. 모델링을 하는 과정에서 목적과 목표 변수의 유형에 따라 몇가지의 다른 평가 지표를 활용하게 된다. 쉽게 말해, 내가 원하는 모델링의 목적에 맞게 알맞은 지표를 보고,오차율을 낮춰가며 좋은 성능의 모델을 만들어낼 수 있는 지표이다. 성능 평가지표는 분류모델과 회귀 모델의 평가모델이 있는데 이번에는 분류 모델의 평가지표에 대해서 다뤄볼 예정이다. 성능 평가 지표 종류 정확도(Accuracy) 오차 행렬(Confusion Matrix) 정밀도 (Precision) 재현율(Recall) F1-score ROC-AUC 정확도(Acc..
❖ Data Scaling : Data Scaling은 데이터 전처리 과정 중의 하나이다. 피처(feature)들마다 데이터값의 범위가 다 제각각이기 때문에 범위 차이가 클 경우 데이터를 갖고 모델을 학습할 때 0으로 수렴하거나 무한으로 발산할 수 있다. 즉, 이러한 머신러닝을 Data Scaling 방법을 이용하여 모든 피처들의 데이터 분포나 범위를 동일하게 조정할 수 있다. 표준화 데이터의 피처 각각이 평균이 0 이고, 분산이 1인 가우시안 정규 분포를 가진 값으로 변환하는 것 → x값이 최소일 떄 분자가 최소가 되어 x'은 0이되고, x값이 최대일 때 분자와 분모가 같으므로 x'은 1 정규화 서로 다른 피처의 크기를 통일하기 위해 데이터의 크기를 0~1사이로 변환해주는 개념이다. → ..