Skip to content
DigitalNeuron
모델·연구

멀티모달 모델

multimodal · vision-language model · VLM

한 줄로

멀티모달 모델은 같은 요청에서 둘 이상의 입력 종류를 처리한다. 가장 흔한 것은 텍스트와 이미지이며 오디오·영상도 늘고 있다. 텍스트가 아닌 입력도 토큰과 같은 내부 표현으로 변환되므로, 이미지 한 장이 컨텍스트 윈도우의 상당 부분을 먹을 수 있다.

멀티모달 모델은 한 요청에서 종류가 다른 입력을 다룬다 — 차트에 대해 묻거나, 오디오를 받아 답하거나, 오류 메시지 스크린샷을 읽는 일.

기계적으로는, 텍스트가 아닌 입력이 인코더를 거쳐 언어모델이 소비하는 것과 같은 공간의 벡터가 된다. 모델 입장에서는 하나의 시퀀스이고, 이미지는 그 안의 한 구간으로 도착할 뿐이다.

여기서 곧바로 따라오는 실무적 결과가 있다. 이미지는 컨텍스트 예산을 먹는다. 고해상도 스크린샷 한 장이 컨텍스트 윈도우에서 텍스트 몇 쪽만큼을 차지하고, 과금도 그만큼이다. 세밀한 디테일이 필요 없는 작업이라면 보내기 전에 축소하는 것은 대개 정확도 손해 없는 공짜 절약이다.

능력은 고르지 않으므로 가정하지 말고 시험하는 편이 좋다. 이미지 속 글자를 읽는 것, 장면을 서술하는 것, 도표를 해석하는 것은 서로 다른 기술이고 신뢰도도 다르다. 빽빽한 표, 손글씨, 그리고 정확한 값 비교가 답을 좌우하는 차트가 여전히 약점이다 — 모델이 잘못 읽은 숫자를 자신 있게 내놓을 수 있다.

자주 묻는 질문

이미지 한 장이 컨텍스트를 얼마나 먹나?
해상도와 제공자의 인코딩 방식에 따라 다르지만, 전체 화면 스크린샷은 흔히 1,000토큰 이상이다. 이미지를 대량으로 보내기 전에 제공자의 계산식을 확인하라.
멀티모달 모델은 이미지를 만들 수도 있나?
읽는 능력과 만드는 능력은 별개다. 많은 모델이 이미지를 입력으로 받으면서 출력은 텍스트만 낸다. 이미지 생성은 별도 모델인 경우가 많고, 때로는 도구로 호출된다.

함께 보기

2026년 8월 22일 최종 갱신