요금·도입 · Latency초보갱신일 2026. 10. 1.
응답 지연(레이턴시)
요청을 보낸 뒤 AI 답이 나오기까지 걸리는 시간입니다.
비유
카페에서 주문하고 음료가 나오기까지 기다리는 시간과 같습니다. 길면 줄이 이탈합니다.
이렇게 이해하세요
레이턴시는 모델 크기, 토큰 수, 도구 호출, 네트워크, 큐에 영향을 받습니다. 제품에서는 첫 토큰 시간(TTFT)과 전체 완료 시간을 구분해 측정합니다. 초보자는 ‘더 큰 모델=항상 느림’만 외우지 말고, 스트리밍·캐시·짧은 컨텍스트로 체감 속도를 개선할 수 있음을 알아 두세요. 요금·한도와 함께 SLA를 볼 때 핵심 지표입니다.
한 줄 암기
레이턴시 = 주문 후 나오는 시간
좋은 예
고객 챗은 스트리밍+작은 모델, 심야 배치 분석은 큰 모델로 나눈다.
피하기
실시간 UI에 초장문 컨텍스트+다중 도구를 동기 호출한다.
관련 서비스
관련 에이전트
관련 용어
요금·도입 더보기관련 링크
자주 묻는 질문
스트리밍이 빠른가요?
총 계산량은 비슷해도, 첫 글자가 빨리 보여 체감 대기가 줄어듭니다.
에이전트는 왜 더 느리나요?
도구 호출·계획 루프가 여러 번 돌기 때문입니다. 타임아웃과 단계 제한이 필요합니다.