Открыть сервис

Стандарт Unicode и кодировка эмодзи

Стандарт Unicode — это международный стандарт кодирования символов, позволяющий единообразно представлять текст на всех языках мира, а также знаки препинания, математические символы и пиктограммы (эмодзи). Стандарт разрабатывается и поддерживается некоммерческим консорциумом Unicode Consortium, основанным в 1991 году. Unicode сопоставляет каждому символу уникальный числовой код (кодовую точку) и обеспечивает совместимость с более ранними кодировками, такими как ASCII.

История и развитие

Предшественниками Unicode были национальные и региональные кодировки (например, Windows-1251 для кириллицы), которые не могли одновременно отображать символы разных языков. В конце 1980-х годов возникла потребность в универсальной системе. В 1991 году был опубликован первый том стандарта, содержащий около 7 000 символов. К 2024 году стандарт включает более 149 000 символов, охватывающих письменности практически всех живых и многих мёртвых языков мира.

Первоначально предполагалось, что каждый символ будет кодироваться 16 битами (65 536 позиций), однако позже пространство было расширено до 1 114 112 кодовых позиций. Это позволило включить в стандарт исторические письменности, редкие иероглифы и пиктограммы.

Кодировки представления

Unicode определяет только соответствие «символ — код». Для хранения и передачи текста используются различные схемы кодирования (UTF):

  • UTF-8 — переменная длина (от 1 до 4 байт). Наиболее распространённая кодировка в вебе, полностью совместима с ASCII.
  • UTF-16 — переменная длина (2 или 4 байта). Используется в операционных системах Windows и средах Java.
  • UTF-32 — фиксированная длина (4 байта). Упрощает обработку текста, но требует больше памяти.

Выбор кодировки не влияет на набор символов, но определяет эффективность хранения и обработки данных.

Эмодзи как часть Unicode

Эмодзи — это графические символы (пиктограммы), включённые в стандарт Unicode как обычные символы. Первая партия из 76 эмодзи была добавлена в стандарт в 2010 году (версия 6.0). К 2024 году количество эмодзи превышает 3 600.

Структура и классификация

Эмодзи делятся на несколько категорий: смайлики и эмоции, люди и жесты, животные и природа, еда и напитки, путешествия и транспорт, символы и флаги. Каждый эмодзи имеет уникальную кодовую точку, но некоторые могут состоять из нескольких кодов (последовательностей).

Механизм модификаторов

Для отображения тона кожи, цвета волос и других вариаций используются модификаторы. Например, базовый символ «👋» (U+1F44B) в сочетании с модификатором тона кожи (U+1F3FB–U+1F3FF) образует варианты с разным цветом кожи. Такие последовательности называются ZWJ-последовательностями (zero-width joiner), когда несколько символов соединяются через специальный невидимый символ U+200D.

Флаги и сложные последовательности

Флаги стран кодируются как пара региональных индикаторов (буквы A–Z). Например, флаг России — это последовательность U+1F1F7 (региональный индикатор R) и U+1F1FA (региональный индикатор U). Существуют также составные эмодзи, например, «семья» (👨👩👧) собирается из нескольких символов мужчины, женщины, девочки и соединителей.

Проблемы и ограничения

  • Отображение на разных платформах. Один и тот же код эмодзи может выглядеть по-разному на устройствах Apple, Android, Windows и в веб-сервисах. Unicode определяет только абстрактный символ, а внешний вид зависит от шрифтов производителя.
  • Отсутствие символов. Некоторые языки и редкие символы до сих пор не включены в стандарт, что вызывает дискуссии в консорциуме.
  • Семантическая неоднозначность. Эмодзи могут интерпретироваться по-разному в зависимости от контекста и культурных особенностей.
  • Совместимость со старыми системами. Некоторые старые программы не поддерживают новые версии Unicode и отображают символы в виде квадратов (так называемые «тофу»).

Применение

Unicode является основой для всех современных операционных систем, языков программирования, баз данных и веб-технологий. Стандарт используется в протоколах электронной почты, мессенджерах, социальных сетях и системах электронного документооборота. Эмодзи, в свою очередь, стали неотъемлемой частью цифровой коммуникации: по данным Unicode Consortium, около 92 % интернет-пользователей используют эмодзи в переписке.

Критика

Критики отмечают, что процесс добавления новых символов в стандарт занимает годы и подвержен влиянию крупных корпораций. Также высказываются опасения по поводу культурной унификации: стандарт преимущественно ориентирован на западные и восточноазиатские письменности, тогда как письменности Африки и Юго-Восточной Азии представлены слабее.

Источники

  • The Unicode Standard, Version 15.1 (Unicode Consortium, 2023)
  • Unicode Emoji Charts (Unicode Consortium, 2023)
  • Документация по UTF-8 и UTF-16 (RFC 3629, RFC 2781)

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →