실전 안내

UTF-8 바이트 계산과 인코딩 이해하기

한글·영문·이모지의 바이트 크기와 UTF-8, UTF-16, EUC-KR의 차이를 실제 예로 설명합니다.

인코딩은 문자를 바이트로 바꾸는 약속입니다

컴퓨터의 저장장치는 문자가 아니라 바이트를 저장합니다. 인코딩은 ‘가’, ‘A’, ‘😀’ 같은 문자를 어떤 바이트 배열로 바꿀지 정한 규칙입니다. 같은 문자도 UTF-8, UTF-16, EUC-KR에서 크기가 달라질 수 있습니다.

UTF-8에서 자주 쓰는 크기

범주일반적인 UTF-8 크기
ASCII 영문·숫자A, 1, !1바이트
한글 완성형가, 한3바이트
일본어·중국어日, 中대부분 3바이트
기본 이모지😀4바이트
결합 이모지👨‍👩‍👧‍👦여러 문자 합계로 25바이트

왜 일부 사이트는 한글을 2바이트라고 하나요?

과거 한국어 서비스는 EUC-KR이나 CP949를 많이 사용했고, 여기서는 흔한 한글이 2바이트였습니다. UTF-16에서도 한글 한 음절은 보통 2바이트입니다. 따라서 ‘한글 2바이트’라는 설명은 특정 인코딩에서는 맞지만 UTF-8 웹페이지에는 맞지 않습니다.

바이트 제한을 만났을 때 확인 순서

  1. 서비스가 인코딩 이름을 공개했는지 찾습니다.
  2. UTF-8이라고 명시되면 이 사이트의 UTF-8 값을 사용합니다.
  3. 문자메시지라면 SMS/LMS 발송 업체의 한글·특수문자 기준을 따릅니다.
  4. 이모지와 특수문자는 예상보다 큰 공간을 쓰므로 여유를 둡니다.

파일 크기와는 왜 조금 다를 수 있나요?

텍스트 파일에는 BOM, 줄바꿈 형식, 메타데이터가 추가될 수 있습니다. 이 도구는 입력한 본문 문자열의 UTF-8 바이트만 계산하므로 저장된 파일 전체 크기와 몇 바이트 차이가 날 수 있습니다.

작성 및 검수: ToolsForMe 운영 · 최종 수정: 2026년 7월 22일