목록전체 글 (24)
ShuyaVision
Optical Flow 란 ?비디오나, 연속된 이미지 프레임 간의 물체 또는 픽셀의 이동 벡터를 추정하는 문제이다.이는 각 픽셀 위치 (x, y)에서의 움직임을 나타내는 2차원 벡터 (u, v)로 표현된다. 주요 목표로는 Dense Flow (모든 픽셀의 움직임을 추정), Sparse Flow (특정 관심 지점만 추정) 이 있다. 기본 가정은 아래와 같다.1. Brightness Constancy Assumption (밝기 불변 가정)- 동일한 점은 시간에 따라 밝기가 변하지 않는다고 가정한다. 밝기가 변하게 되면 동일한 점이라고 판단하기 어려울 수 있기 때문이다. 이는 수식으로 아래와 같이 표현된다. 즉, 시간 t에 위치 (x, y)의 픽셀이 다음 프레임 (t + 1)에서는 (x + u, y + v)로..
policy gradient 직관적 개념 정리1. REINFORCE 알고리즘강화학습은 no-data로 시작한다. Agent 가 데이터를 수집해온걸 바탕으로 학습을 진행한다. terminal-point 도 우리가 지정하는 것이다.어떤 Agent가 어떤 state에 놓이게 된다. 이 때 policy 를 통해 action을 output으로 받는다. REINFORCE algorithm은 policy를 학습하는게 목적이므로, policy의 paramter theta가 존재한다.(learnable paramter)이제, Agent는 trajectory(s, a의 연속 집합, episode 라고도 부름) 을 시작하면서 연속적으로 어떠한 행동을 한다. 이 때, 여기서 나온 모든 Reward(Reward 함수는 사전 정..
S4: Efficiently Modeling Long Sequences with Structured State Spaces LSSL의 한계 극복한 점을 중점으로 정리한다. S4 논문에서는, LSSL 모델은 실 사용을 하기에는 계산 비용과 메모리 사용량이 매우 크다는 한계가 있다고 한다.그래서 S4 에서는, SSM 모델의 수학적 강점을 유지하면서도, 이를 더 효율적으로 계산할 수 있는 방법을 제시한다. 3.1 Motivation : DiagonlizationSSM의 discrete-time 버전을 계산할 때 가장 큰 병목은, 행렬 A에 대해 반복적으로 곱셈을 수행해야한다는 점이다. 예를 들어, LSSL에서 L 길이의 시퀀스와 N차원의 상태 공간을 다루면 \( O(N^{2}L) \) 이라는 매우 큰 계산량이..
LSSL (Linear State Space Layer)S4, Mamba 를 이해하기 위한 핵심 개념 위주로 정리한다.1. SSM (State Space Model)이전 포스팅에서 정리했듯, State Space Model은 시스템의 "내부 상태(state)"가 시간의 흐름에 따라 어떻게 변화하고, 이 상태가 어떻게 외부로 "출력(output)" 되는지를 수학적 방정식으로 표현하는 동적 시스템 모델이다.$$ x'(t) = Ax(t) + Bu(t) $$$$ y(t) = Cx(t) + Du(t) $$ HiPPO 논문에서는, 연속 시간 함수 u(t)의 과거 히스토리를, 정해진 측도 (weight function) 에 따라 고차 다항식 기반으로 projection 한다. 이를 통해 다음과 같은 continous..
Mamba를 이해하기 위한 배경지식을 정리해보려고 한다.SSM 의 정의State Space Model (상태 공간 모델, SSM) 은 시스템의 "내부 상태(state)" 가 시간의 흐름에 따라 어떻게 변화하고, 이 상태가 어떻게 외부로 "출력(output)" 되는지를 수학적 방정식(행렬)으로 표현하는 대표적인 동적 시스템 모델이다.- 제어이론, 신호처리, 통계 그리고 최신 딥러닝까지 널리 사용된다.- 물리적 시스템 (로봇, 차량, 센서), 경제, 텍스트 등 모든 시계열/연속 데이터를 모델링 할 수 있다. SSM을 써서 모델링을 한다는 것은, 시간에 따라 결정되는 함수가 있고, 입력값의 가장 처음 시점부터, t 시점까지 확보했을 때, 그 시점의 출력을 예측하기 위한 시스템을 만든다는 것이다. 즉 u(t) ..
DeepLabV3+는 이전 DeepLab 들과 유사하다. DeepLabV2(https://sangbro.tistory.com/11) DeepLabV3(https://sangbro.tistory.com/24) 다만, 기존 DeepLabV2, V3에서는 ResNet을 활용했는데, V3+에서는 Xception을 사용한다. Xception은 Depthwise Separable Conv를 처음으로 소개, 및 사용하는 모델이고, DeepLabV3+에서는 Depthwise Separable Conv에 Atrous 를 결합하여 사용한다. Depthwise Separable Conv에 대한 자세한 내용은 MobileNet 포스팅을 참조하면 된다. MobileNetV1, V2 (https://sangbro.tistory...
DeepLabv3은 DeepLabv2(https://sangbro.tistory.com/11)와 유사하다. 이에, 어떤 부분을 수정하여 발전시켰는지, 그리고 저자들의 실험에 대해서 중점적으로 작성하려고 한다. DeepLabV2 vs DeepLabV3 총 2가지 부분에서 차별화를 두었다. 1. ASPP(Atrous Spatial Pyramid Pooling)의 Rate 비율이 다르고, Sum이 아닌 Concat을 사용한다. 2. GAP(Global Average Pooling) 기법이 도입되었다. DeepLabV2에서의 Figure이다. ResNet 마지막 몇 Conv Layer를 없애고, 위 구조의 ASPP를적용한다. 기존 이미지의 1/16 수준의 feature map의 크기에서 ASPP를 진행한 후에 ..
Abstract & Introduction 기존의 Transformer를 Vision task에 적용하기에는 크게 2가지 문제점이 있다고 말한다. 첫번째로는 visual entities의 scale이 text에 비해 다양하다는 점이다. NLP에서는 word를 embedding한 token 형태로 사용하기 때문에 크기를 고정적으로 활용하고, 기존의 Transformer 들은 대부분 이를 기반으로 구성되어 있다. 하지만 visual entities는 환경, 이미지의 종류에 따라 scale이 다양하게 잡히는 경우가 많다. 특히 Object Detection과 같은 경우, DETR에서는 작은 물체를 잡지 못하는 문제점이 존재했듯, visual elements는 scale에 따라 크기가 따라 변하기 때문에 NLP..