멀티모달 모델
multimodal · vision-language model · VLM
한 줄로
멀티모달 모델은 같은 요청에서 둘 이상의 입력 종류를 처리한다. 가장 흔한 것은 텍스트와 이미지이며 오디오·영상도 늘고 있다. 텍스트가 아닌 입력도 토큰과 같은 내부 표현으로 변환되므로, 이미지 한 장이 컨텍스트 윈도우의 상당 부분을 먹을 수 있다.
멀티모달 모델은 한 요청에서 종류가 다른 입력을 다룬다 — 차트에 대해 묻거나, 오디오를 받아 답하거나, 오류 메시지 스크린샷을 읽는 일.
기계적으로는, 텍스트가 아닌 입력이 인코더를 거쳐 언어모델이 소비하는 것과 같은 공간의 벡터가 된다. 모델 입장에서는 하나의 시퀀스이고, 이미지는 그 안의 한 구간으로 도착할 뿐이다.
여기서 곧바로 따라오는 실무적 결과가 있다. 이미지는 컨텍스트 예산을 먹는다. 고해상도 스크린샷 한 장이 컨텍스트 윈도우에서 텍스트 몇 쪽만큼을 차지하고, 과금도 그만큼이다. 세밀한 디테일이 필요 없는 작업이라면 보내기 전에 축소하는 것은 대개 정확도 손해 없는 공짜 절약이다.
능력은 고르지 않으므로 가정하지 말고 시험하는 편이 좋다. 이미지 속 글자를 읽는 것, 장면을 서술하는 것, 도표를 해석하는 것은 서로 다른 기술이고 신뢰도도 다르다. 빽빽한 표, 손글씨, 그리고 정확한 값 비교가 답을 좌우하는 차트가 여전히 약점이다 — 모델이 잘못 읽은 숫자를 자신 있게 내놓을 수 있다.
자주 묻는 질문
- 이미지 한 장이 컨텍스트를 얼마나 먹나?
- 해상도와 제공자의 인코딩 방식에 따라 다르지만, 전체 화면 스크린샷은 흔히 1,000토큰 이상이다. 이미지를 대량으로 보내기 전에 제공자의 계산식을 확인하라.
- 멀티모달 모델은 이미지를 만들 수도 있나?
- 읽는 능력과 만드는 능력은 별개다. 많은 모델이 이미지를 입력으로 받으면서 출력은 텍스트만 낸다. 이미지 생성은 별도 모델인 경우가 많고, 때로는 도구로 호출된다.