실전 안내
UTF-8 바이트 계산과 인코딩 이해하기
한글·영문·이모지의 바이트 크기와 UTF-8, UTF-16, EUC-KR의 차이를 실제 예로 설명합니다.
인코딩은 문자를 바이트로 바꾸는 약속입니다
컴퓨터의 저장장치는 문자가 아니라 바이트를 저장합니다. 인코딩은 ‘가’, ‘A’, ‘😀’ 같은 문자를 어떤 바이트 배열로 바꿀지 정한 규칙입니다. 같은 문자도 UTF-8, UTF-16, EUC-KR에서 크기가 달라질 수 있습니다.
UTF-8에서 자주 쓰는 크기
| 범주 | 예 | 일반적인 UTF-8 크기 |
|---|---|---|
| ASCII 영문·숫자 | A, 1, ! | 1바이트 |
| 한글 완성형 | 가, 한 | 3바이트 |
| 일본어·중국어 | 日, 中 | 대부분 3바이트 |
| 기본 이모지 | 😀 | 4바이트 |
| 결합 이모지 | 👨👩👧👦 | 여러 문자 합계로 25바이트 |
왜 일부 사이트는 한글을 2바이트라고 하나요?
과거 한국어 서비스는 EUC-KR이나 CP949를 많이 사용했고, 여기서는 흔한 한글이 2바이트였습니다. UTF-16에서도 한글 한 음절은 보통 2바이트입니다. 따라서 ‘한글 2바이트’라는 설명은 특정 인코딩에서는 맞지만 UTF-8 웹페이지에는 맞지 않습니다.
바이트 제한을 만났을 때 확인 순서
- 서비스가 인코딩 이름을 공개했는지 찾습니다.
- UTF-8이라고 명시되면 이 사이트의 UTF-8 값을 사용합니다.
- 문자메시지라면 SMS/LMS 발송 업체의 한글·특수문자 기준을 따릅니다.
- 이모지와 특수문자는 예상보다 큰 공간을 쓰므로 여유를 둡니다.
파일 크기와는 왜 조금 다를 수 있나요?
텍스트 파일에는 BOM, 줄바꿈 형식, 메타데이터가 추가될 수 있습니다. 이 도구는 입력한 본문 문자열의 UTF-8 바이트만 계산하므로 저장된 파일 전체 크기와 몇 바이트 차이가 날 수 있습니다.
작성 및 검수: ToolsForMe 운영 · 최종 수정: 2026년 7월 22일