생성·멀티모달 · Multimodal초보갱신일 2026. 10. 1.
멀티모달
글·이미지·음성·영상처럼 여러 종류의 입출력을 함께 다루는 AI입니다.
비유
눈과 귀와 입을 같이 쓰는 사람처럼, 사진도 보고 말도 듣고 글도 쓰는 만능 감각 도우미입니다.
이렇게 이해하세요
멀티모달 AI는 텍스트만이 아니라 이미지, 오디오, 비디오 등 여러 모달리티를 이해하고 생성합니다. 스크린샷을 보고 설명하기, 스케치를 보고 시안 제안, 음성 회의를 요약하는 식의 업무가 가능해집니다. 모델마다 지원하는 입력·출력 조합과 용량 한도가 다르므로, ‘된다’고 가정하기 전에 제품 스펙을 확인해야 합니다. 시각 정보는 텍스트보다 토큰·비용이 클 수 있고, 개인정보가 찍힌 이미지는 업로드 전에 가려야 합니다. 초보자는 텍스트 프롬프트에 ‘무엇을 보고 무엇을 출력할지’를 분명히 적는 연습부터 하면 됩니다.
한 줄 암기
멀티모달 = 여러 감각으로 주고받기
좋은 예
제품 사진과 함께 ‘이 패키지에서 개선할 UX 3가지를 초보 고객 관점으로’라고 요청한다.
피하기
주민번호가 보이는 서류 사진을 무심코 업로드하고 일반 질문에 섞는다.
관련 서비스
관련 용어
생성·멀티모달 더보기관련 링크
자주 묻는 질문
이미지 생성만 멀티모달인가요?
아니요. 이미지 이해(비전), 음성 입출력, 영상 요약 등도 멀티모달에 포함됩니다.
텍스트 모델과 결과가 다른 이유는?
시각·청각 신호가 추가되어 맥락이 달라지고, 모델 능력·해상도 한도도 영향을 줍니다.