목록전체 글 (8)
DEVDAE
https://velog.velcdn.com/images/cdwoong828/post/8d2a90ae-57bd-49af-be68-e34d74c4201a/image.png) ## Introduction Self-supervised learning에서 문장 내 존재하는 단어를 마스크한 문장을 재복원하는 denoising autoencoder인 Masked Language Model이 NLP에서 주목할만한 성과를 보여줬다. 이러한 방법론은 특정 task 예를들어 span prediction, generation등에서 잘 작동한다. - 하지만 모든 테스크에 적용하기는 어렵다. BERT는 인코더이기 때문에 Generation task에 대응할 수 없다. GPT는 디코더만 존재하기 때문에 양방향 문맥정보를 반영하지..
제가 서울대학교 공간데이터 연구실에서 진행한 논문리뷰 공유합니다.
Quoc Le QVL@GOOGLE.COM Tomas Mikolov TMIKOLOV@GOOGLE.COM Google Inc, 1600 Amphitheatre Parkway, Mountain View, CA 94043 서울대학교 최대웅 작성 1. Abstract 텍스트 처리를 위해 가장 많이 사용되는 bagofwords의 문제점 해결 방법 제안 Bag of words 는 단어의 순서를 무시하고 의미를 고려하지 않음 > 비슷한 의미의 단어나 관련 있는 단어들이 모두 동일하게 처리됨 Paragraph Vector 을 제안 > 문서의 길이가 다양한 경우에 대응할 수 있는 dense예측하도록 학습 vector 을 학습하여, 문서를 나타내는 특징 벡터로 사용, 해당 문서 내의 단어들을 실험 결과 bagofwords ..
자바스크립트는 객채(object) 기반의 스크립트 언어다. HTML = 웹의 내용, CSS = 웹 디자인, 자바스크립트 = 웹의 동작 구현 주로 웹 브라우저에서 사용되나, Node.js와 같은 프레임워크로 서버 구축 프로그래밍에서도 사용 가능 현재 대부분의 컴퓨터나 스마트폰의 웹 브라우저에는 자바스크립트 인터프리터가 내장되어 있음 1995년 넷스케이프의 브렌던 아이크에 의해 만들어짐 처음에는 모카라는 이름으로 개발되었으나 그 후 라이브스크립트, 최종적으로는 자바스크립트로 변경됨 자바스크립트의 특징 객체 기반의 스크립트 언어 동적이며, 타입을 명시할 필요가 없는 언어 객체 지향형 프로그래밍과 함수형 프로그래밍을 모두 표현 가능 C언어의 exe 컴파일 작업과 같은 작업을 인터프리터 언어는 거치치 않고 소스 ..
추천시스템은 어떤 작업(추천)을 할때, 경험(유저의 행동패턴)을 통해, 그 작업에 대한 성능이 향상(추천을 더 정확하게 해준다)되는 프로그램입니다. 1. 유저와 상품의 관계를 표현한 데이터 사용 2. 유저와 상호 작용이 없었던 상품에 대한 선호도 예측 3. 선호도가 높게 예측되는 상품들 유저에게 추천 추천 시스템 데이터 1. 직접 데이터 (explicit data) 1. 유저가 직접적으로 상품에 대한 만족/선호도를 표시한 데이터 2. 유저 영화 평점 데이터 (1~5로 선호도 표시) 3. 유튜브 유저 좋아요/싫어요 데이터 (0,1로 선호도 표시) - 유저 선호도를 정확하게 나타낸다. 2. 간접 데이터(implicit data) 1. 유저가 직접적으로 선호도를 표시하지는 않았지만 유추할 수 있는 데이터 2...
선형 회귀를 사용해서 찾은 직선은 입력 변수와 목표 변수의 관계를 잘 나타내지 못하고 있다. 곡선을 사용해서 더 나은 함수를 찾았다. 곡선은 1차 함수인 직선과 다르게 2차 함수이다. 아래는 2차 함수 식이다. 함수가 높아질수록 굴곡이 많은 곡선이 되고 이런식으로 데이터에 잘 맞는 일차 함수나 직선이 아닌 다항식이나 곡선을 수하는걸 다항 회귀 영어로는 polynomial regression이라고 한다. 다항 회귀는 다중 선형 회귀와 매우 비슷하다. 다음 식은 위에는 다항 회귀 밑은 다중 선형 회귀이다. 이 테이블에 가상의 열 두개를 추가한다. 크기를 제곱한 열과 세제곱한 열이다. 그러면 이 데이터를 입력 변수가 3개인 것처럼 취급해 다중 선형 회귀를 하면 된다. 이것은 입력변수가 하나일때 하는 방법이다...
다중 선형 회귀는 선형 회귀를 하나의 입력 변수가 아니라 여러개의 입력 별수를 사용해서 목표 변수를 예측하는 알고리즘이다. 용어 노트 다중 선형 회귀 가설 함수 선형 회귀와는 다르게 입력변수가 여러 개 있다. (집 데이터에서 집 크기, 지하철까지의 거리, 년식 등) 행렬표현 이건 아래의 식과 같다. 이 두 벡터를 곱하면 1번 요소끼리 곱하고 2번 요소끼리 곱하고 다 더 하면 기존 함수와 같은 식이 된다. Error = 위의 식은 행렬로 아래의 식으로 변환해 표현 가능 다중 선형 회귀 경사하강법 구현 import numpy as np def prediction(X, theta): """다중 선형 회귀 가정 함수. 모든 데이터에 대한 예측 값을 numpy 배열로 리턴한다 위에서 세타 곱하기 X 부분 구현 "..
위의 그림과 같이 집 크기가 주어졌을 때, 이걸 이용해서 집 값을 예측하는, 이 데이터에 가장 잘 맞는 가장 적절한 하나의 선을 찾아내는 것이 선형 회귀이다. 이 선은 통계학에서는 Line of best fit 이라고 한다. 변수 선형 회귀를 이용해 맞추려고 하는 값을 '목표 변수' 영어로는 target variable 또는 output variable 하고 한다. 그리고 이 목표 변수를 맞추기 위해서 사용하는 값을 '입력 변수' input variable 라고 한다. 일반적으로는 feature라고 한다. 위의 그래프에서는 집 크기는 입력 변수, 집 값은 목표 변수가 된다. 데이터 표현볍 프로그램을 학습시키기 위해 사용하는 데이터를 학습 데이터 라고 한다. 학습 데이터의 개수는 보통 m이라는 문자로 표현..