Юникод

Юнико́д^[1](англ.Unicode) — стандарткодирования символов,включающий в себя знаки почти всех письменныхязыковмира^[2].В настоящее время стандарт является преобладающим вИнтернете.

Стандарт предложен в1991 годунекоммерческой организацией «Консорциум Юникода» (англ.Unicode Consortium, Unicode Inc.)^[3]^[4].Применение этого стандарта позволяет закодировать очень большое число символов из разных систем письменности: в документах, закодированных по стандарту Юникод, могут соседствовать китайскиеиероглифы,математические символы, буквыгреческого алфавита,латиницыикириллицы,символы музыкальной нотной нотации, при этом становится ненужным переключениекодовых страниц^[5].

Стандарт состоит из двух основных частей: универсального набора символов (англ.Universal character set, UCS) и семейства кодировок (англ.Unicode transformation format, UTF). Универсальный набор символов перечисляет допустимые по стандарту Юникод символы и присваивает каждому символу код в виде неотрицательного целого числа, записываемого обычно в шестнадцатеричной форме с префиксомU+,например,U+040F.Семейство кодировок определяет способы преобразования кодов символов для передачи в потоке или в файле.

Коды в стандарте Юникод разделены на несколько областей. Область с кодами от U+0000 до U+007F содержит символы набораASCII,и коды этих символов совпадают с их кодами в ASCII. Далее расположены области символов других систем письменности, знаки пунктуации и технические символы. Часть кодов зарезервирована для использования в будущем^[6].Под символы кириллицы выделены области знаков с кодами от U+0400 до U+052F, от U+2DE0 до U+2DFF, от U+A640 до U+A69F (см.Кириллица в Юникоде)^[7].

Предпосылки создания и развитие Юникода

Unicode — это уникальный код для любого символа, независимо от платформы, независимо от программы, независимо от языка.Консорциум Юникода^[8]

К концу 1980-х годов стандартом стали 8-битные кодировки, их существовало уже большое множество, и постоянно появлялись новые. Это объяснялось как расширением круга поддерживаемых языков, так и стремлением создавать кодировки, частично совместимые между собой (характерный пример — появлениеальтернативной кодировки для русского языка,обусловленное эксплуатацией западных программ, созданных для кодировкиCP437). В результате появилось несколько проблем:

проблема неправильной раскодировки;
проблема ограниченности набора символов;
проблема преобразования одной кодировки в другую;
проблема дублирования шрифтов.

Проблема неправильной раскодировкивызывала появление в документе символов иностранных языков, не предполагавшихся в документе, или появление не предполагавшихсяпсевдографическихсимволов, прозванных русскоязычными пользователями «кракозябрами». Проблема во многом была вызвана отсутствием стандартизированной формы указания кодировки для файла или потока. Проблему можно было решить либо последовательным внедрением стандарта указания кодировки, либо внедрением общей для всех языков кодировки.^[5]

Проблема ограниченности набора символов^[5].Проблему можно было решить либо переключением шрифтов внутри документа, либо внедрением «широкой» кодировки. Переключение шрифтов издавна практиковалось втекстовых процессорах,причём часто использовалисьшрифты с нестандартной кодировкой,т. н. «dingbat fonts». В итоге при попытке переноса документа в другую систему все нестандартные символы превращались в «кракозябры».

Проблема преобразования одной кодировки в другую.Проблему можно было решить либо составлением таблиц перекодировки для каждой пары кодировок, либо использованием промежуточного преобразования в третью кодировку, включающую все символы всех кодировок^[9].

Проблема дублирования шрифтов.Для каждой кодировки создавался свой шрифт, даже если наборы символов в кодировках совпадали частично или полностью. Проблему можно было решить путём создания «больших» шрифтов, из которых впоследствии выбирались бы нужные для данной кодировки символы. Однако это требовало создания единого реестра символов, чтобы определять, чему что соответствует.

Была признана необходимость создания единой «широкой» кодировки. Кодировки с переменной длиной символа, широко использующиеся в Восточной Азии, были признаны слишком сложными в использовании, поэтому было решено использовать символы фиксированной ширины. Использование 32-битных символов казалось слишком расточительным, поэтому было решено использовать 16-битные.

Первая версия Юникода представляла собой кодировку с фиксированным размером символа в 16 бит, то есть общее число кодов было 2¹⁶(65 536). С тех пор символы стали обозначать четырьмя шестнадцатеричными цифрами (например,U+04F0). При этом в Юникоде планировалось кодировать не все существующие символы, а только те, которые необходимы в повседневном обиходе. Редко используемые символы должны были размещаться в «области пользовательских символов» (private use area), которая первоначально занимала кодыU+D800…U+F8FF.Чтобы использовать Юникод также и в качестве промежуточного звена при преобразовании разных кодировок друг в друга, в него включили все символы, представленные во всех наиболее известных кодировках.

В дальнейшем, однако, было принято решение кодировать все символы и в связи с этим значительно расширить кодовую область. Одновременно с этим коды символов стали рассматриваться не как 16-битные значения, а как абстрактные числа, которые в компьютере могут представляться множеством разных способов (см.способы представления).

Поскольку в ряде компьютерных систем (например,Windows NT^[10]) фиксированные 16-битные символы уже использовались в качестве кодировки по умолчанию, было решено все наиболее важные знаки кодировать только в пределах первых 65 536 позиций (так называемаяангл.Basic Multilingual Plane, BMP). Остальное пространство используется для «дополнительных символов» (англ.supplementary characters): систем письма вымерших языков или очень редко используемыхкитайскихиероглифов, математических и музыкальных символов.

Для совместимости со старыми 16-битными системами была изобретена системаUTF-16,где первые 65 536 позиций, за исключением позиций из интервала U+D800…U+DFFF, отображаются непосредственно как 16-битные числа, а остальные представляются в виде «суррогатных пар» (первый элемент пары из области U+D800…U+DBFF, второй элемент пары из области U+DC00…U+DFFF). Для суррогатных пар была использована часть кодового пространства (2048 позиций), отведённого «для частного использования».

Поскольку в UTF-16 можно отобразить только 2²⁰+2¹⁶−2048 (1 112 064) символов, то это число и было выбрано в качестве окончательной величины кодового пространства Юникода (диапазон кодов: 0x000000-0x10FFFF).

Хотя кодовая область Юникода была расширена за пределы 2¹⁶уже в версии 2.0, первые символы в «верхней» области были размещены только в версии 3.1.

Роль этой кодировки в веб-секторе постоянно растёт. На начало 2010 доля веб-сайтов, использующих Юникод, составила около 50 %^[11].

Версии Юникода

Работа по доработке стандарта продолжается. Новые версии выпускаются по мере изменения и пополнения таблиц символов. Параллельно выпускаются новые документыISO/IEC 10646.

Первый стандарт выпущен в 1991 году, последней версией на данный момент является 15.1.0(12 сентября 2023)^[12].Версии стандарта 1.0—5.0 публиковались как книги и имеютISBN^[13]^[14].

Номер версии стандарта составлен из трёх цифр (например, 3.1.1). Третью цифру меняют при внесении в стандарт небольших изменений, не добавляющих новых символов (исключение — версия 1.0.1, в которой добавленыунифицированные идеограммы китайского, японского и корейского письма)^[15].

База данных символов Юникода (Unicode Character Database) доступна для всех версий на официальном сайте как в простом текстовом, так и в XML-формате. Файлы распространяются под BSD-подобнойлицензией.

Версии Юникода
Номер версии	Дата публикации	ISBNкниги	Издание ISO/IEC 10646	Количествописьменностей^{[A 1]}	Количество символов^{[A 2]}	Изменения
1.0.0^[16]	Октябрь 1991	ISBN 0-201-56788-1(Vol.1)		23	7161	Изначально Юникод содержал символы следующих письменностей:арабское письмо,армянское письмо,бенгальское письмо,чжуиньское письмо,кириллица,деванагари,грузинское письмо,греческое и коптское письмо,гуджарати,гурмукхи,хангыль,еврейское письмо,хирагана,каннада,катакана,лаосское письмо,латиница,малаялам,ория,тамильское письмо,телугу,тайское письмоитибетское письмо^[17]
1.0.1	Июнь 1992	ISBN 0-201-60845-6(Vol.2)		24	28 359	Добавлены 20 902унифицированные идеограммы китайского, японского и корейского письма^[18]
1.1^[19]	Июнь 1993		ISO/IEC 10646-1:1993	23	34 233	Добавлено 4306 слоговхангыля,дополнивших уже имеющиеся в кодировке 2350 символов. Удалены символытибетского письма^[20]
2.0^[21]	Июль 1996	ISBN 0-201-48345-9	ISO/IEC 10646-1:1993 и Amendments 5, 6, 7	24	38 950	Удалены добавленные ранее слогихангыля,и добавлены 11 172 новых слога хангыля с новыми кодами. Возвращены удалённые ранее символытибетского письма;символы получили новые коды и были размещены в разных таблицах. Введён механизм суррогатных (англ.surrogate) символов. Выделено место для плоскостей (англ.planes)15 и 16^[22]
2.1^[23]	Май 1998		ISO/IEC 10646-1:1993, Amendments 5, 6, 7, два символа из Amendment 18	24	38 952	Добавленысимвол евроизаменяющий символ^[24]
3.0^[25]	Сентябрь 1999	ISBN 0-201-61633-5	ISO/IEC 10646-1:2000	37	49 259	Добавлены письмочероки,эфиопское письмо,кхмерское письмо,монгольские письменности,бирманское письмо,огамическое письмо,руны,сингальское письмо,сирийское письмо,тана,канадское слоговое письмоиписьмо и,а также символышрифта Брайля^[26]
3.1^[27]	Март 2001		ISO/IEC 10646-1:2000 ISO/IEC 10646-2:2001	40	94 205	Добавленыдезеретское письмо,готское письмоидревнеиталийское письмо^[англ.],а также символызападнойивизантийской музыки,42 711унифицированных идеограмм китайского, японского и корейского письма.Выделено место для плоскостей1,2и14^[28]
3.2^[29]	Март 2002		ISO/IEC 10646-1:2000 и Amendment 1 ISO/IEC 10646-2:2001	44	95 221	Добавленыписьмо бухид,хануноо^[англ.],байбайиниписьмо тагбанва^[30]
4.0^[31]	Апрель 2003	ISBN 0-321-18578-1	ISO/IEC 10646:2003	51	96 447	Добавленыкипрское письмо,письмо лимбу,линейное письмо Б,сомалийское письмо,алфавит шоу,письмо лыиугаритское письмо,а также символыгексаграмм^[32]
4.1^[33]	Март 2005		ISO/IEC 10646:2003 и Amendment 1	59	97 720	Добавленыписьмо лонтара,глаголица,письмо кхароштхи,новое письмо лы,древнеперсидская клинопись,силхетское нагариидревнеливийское письмо.Символыкоптского письмабыли отделены от символовгреческого письма.Также добавленысимволы старых греческих цифр,музыкальные символы Древней Греции исимвол гривны(валютыУкраины)^[34]
5.0^[35]	Июль 2006	ISBN 0-321-48091-0	ISO/IEC 10646:2003, Amendments 1, 2, четыре символа из Amendment 3	64	99 089	Добавленыбалийское письмо,клинопись,письмо нко,монгольское квадратное письмоифиникийское письмо^[36]
5.1^[37]	Апрель 2008		ISO/IEC 10646:2003 и Amendments 1, 2, 3, 4	75	100 713	Добавленыкарийское письмо,чамская письменность,письмо кая-ли,письмо лепча,ликийское письмо,лидийское письмо,письмо ол-чики,реджангское письмо,письмо саураштра,сунданское письмо,древнетюркское письмоиписьмо ваи.Добавленысимволы фестского диска,символы костей длямаджонгаидомино,заглавная буква эсцет(ẞ), а также буквы латиницы, использовавшиеся в средневековыхрукописяхдляаббревиации^[англ.].Новыми символами дополнен набор символовбирманского письма^[38]
5.2^[39]	Октябрь 2009		ISO/IEC 10646:2003 и Amendments 1, 2, 3, 4, 5, 6	90	107 361	Добавленыавестийское письмо,письмо бамум,египетское иероглифическое письмо(посписку Гардинера^[англ.],содержащему 1071 символ),имперское арамейское письмо,пахлевийское эпиграфическое письмо^[англ.],парфянское эпиграфическое письмо^[англ.],яванское письмо,письмо кайтхи,письмо лису,письмо манипури,южноаравийское письмо,древнетюркское письмо,самаритянское письмо,письмо ланнаиписьмо тай-вьет^[англ.].Добавлены 4149 новыхунифицированных идеограмм китайского, японского и корейского письма^[англ.](CJK-C), символыведийского письма,символ тенге(валютыКазахстана), а также расширен набор символов чамостарого хангыля^[40]
6.0^[41]	Октябрь 2010		ISO/IEC 10646:2010 исимвол индийской рупии	93	109 449	Добавленыбатакское письмо,письмо брахми,мандейское письмо.Добавлены символыигральных карт,дорожных знаков,географических карт,алхимии,эмотиконаиэмодзи,а также 222унифицированные идеограммы китайского, японского и корейского письма^[англ.](CJK-D)^[42]
6.1^[43]	Январь 2012		ISO/IEC 10646:2012	100	110 181	Добавленыписьмо чакма,мероитский курсив и мероитские иероглифы,письмо мяо,письмо шарада,письмо соранг-сомпенг^[англ.]иписьмо такри^[44]
6.2^[45]	Сентябрь 2012		ISO/IEC 10646:2012 исимвол турецкой лиры	100	110 182	Добавленсимвол турецкой лиры(валютыТурции)^[46]
6.3^[47]	Сентябрь 2013		ISO/IEC 10646:2012 и шесть символов	100	110 187	Добавлено пять символов для форматирования двунаправленного текста^[48]
7.0^[49]	16 июня 2014		ISO/IEC 10646:2012, Amendments 1, 2 исимвол рубля	123	113 021	Добавленыписьмо басса,агванское письмо,стенография Дюплойе,эльбасанское письмо,письмо грантха,письмо ходжики^[англ.],письменность худавади^[англ.],линейное письмо А,письмо махаджани^[англ.],манихейское письмо,письмо кикакуи,письмо моди,письмо мро^[англ.],набатейское письмо,северноаравийское письмо,древнепермское письмо,письмо пахау,пальмирское письмо,письмо по чин хо^[англ.],письмо псалтирь пехлеви^[англ.],сиддхаматрика,письмо тирхута,варанг-кшитииорнамент дингбат^[англ.],а такжесимвол российского рубляисимвол азербайджанского маната^[50]
8.0^[51]	17 июня 2015		ISO/IEC 10646:2014, Amendment 1,символ лари,9 унифицированных идеограмм ККЯ, 41эмодзи	129	120 737	Добавленыписьмо ахом,анатолийские иероглифы,письмо хатран,письмо мултани,венгерские руны,SignWriting,5776Унифицированные идеограммы ККЯ — расширение E,строчные буквы письмачероки,буквы латиницы для немецкой диалектологии, 41эмодзи,а также пять символов измененияцвета кожидля эмотиконов. Добавленсимвол лари(валютыГрузии)^[52]
9.0^[53]	21 июня 2016		ISO/IEC 10646:2014, Amendments 1, 2, адлам, нева, японские символы для ТВ, 74эмодзии символов	135	128 237	Добавленыписьмо адлам,письмо бхайкшуки,письмо марчен,письмо нева,письмо осейдж,тангутское письмо,а также 72эмодзии японские символы для телевидения^[54]
10.0^[55]	20 июня 2017		ISO/IEC 10646:2017, 56эмодзи,285 символовхэнтайганы,3 символа квадратного письма Дзанабадзара	139	136 755	Добавленыквадратное письмо Дзанабадзара,письмо соёмбо,гонди Масарама,письмо нюй-шу,письмо хэнтайгана,7494Унифицированные идеограммы ККЯ — расширение F,а также 56эмодзии символбиткойна^[56]
11.0	Июнь 2018		ISO/IEC 10646:2017	146	137 439	Добавлены догра,грузинское письмомтаврули, гунджалское гонди,ханифи,индийские цифры сийяк,макасарскоеписьмо, медефайдрин, (древне-)согдийское письмо,цифры майя,5 идеограмм ККЯ, символысянции половин звёздочек для оценки, а также 145эмодзи,четыре символа изменения причёски для эмотиконов и символкопилефта^[57]^[58]^[59]
12.0	Март 2019		ISO/IEC 10646:2017, Amendments 1, 2, а также 62 дополнительных символов	150	137 993	Добавлены элимайское письмо,надинагари^[англ.],хмонг, ванчо, дополнения дляписьма Полларда,малаяканадля старых японских текстов, исторические дроби и символытамильского письма,буквылаосского письмадляпали,буквы латиницы для транслитерации угаритского, управляющие символы форматирования египетских иероглифов, а также 61эмодзи^[60]^[61]
12.1	Май 2019			150	137 994	Добавлен квадратный символ эпохирэйва^[62]^[63]
13.0	Март 2020			154	143 924	Добавленыхорезмийское письмо,письмодивес акуру,малое киданьское письмо,езидское письмо,4969 идеограмм ККЯ (включая 4939Унифицированные идеограммы ККЯ — расширение G), а также 55эмодзи,символыCreative Commonsи символы для унаследованной вычислительной техники. Выделено место дляплоскости 3^[64]^[65]
14.0	Сентябрь 2021			159	144 762	Добавлены письмотото,кипро-минойское письмо,виткутьское письмо,староуйгурское письмо,тангса,дополнительные буквы латиницы (блокиРасширенная латиница — F,Расширенная латиница — G) для использования врасширениях для МФА,добавление арабского письма для использования в языках Африки, Ирана, Пакистана, Малайзии, Индонезии, Явы и Боснии, а также дополнения для использования в Коране, другие дополнения для поддержки языков Северной Америки, Филиппин, Индии и Монголии, добавлениесимвола сома,нотописизнаменного пенияи 37эмодзи.
15.0	Сентябрь 2022			161	149 251	Добавленыалфавит Нагадля языкамундари(≈1950),кави(старояванский),кактовикские цифры,символы кириллицы для записи транскрипции, латинские буквы для записи языкамалаялам,3 лигатуры из турецкого Корана, 1 египетский иероглиф, символы для передачи затёртых египетских иероглифов, символы изджайнизма,звездабахаизма,символы пятитранснептуновых объектови 31эмодзи(включая цвета кожи).
15.1	12 сентября 2023			161	149 878	Добавлены 897 иероглифовкитайских имён,которые китайцы хотели расположить на плоскости 0A; 622 из них опознаны как новые. Также 5 символов структуры китайских иероглифов, 10 разныхZWJ-последовательностейэмодзии 18 последовательностей, изображающих людей, которые смотрят вправо (исключая цвета кожи).
Примечания ↑Включаяединственный код (шрифт Брайля), единственную стенографическую систему (стенография Дюплойе), а такжекатакану,хирагану,жестовое письмо Саттон,исключаяхэнтайгану(считается хираганой), два альтернативных грузинских алфавита (считаютсягрузинским), а также другие нетекстовые: четыре виданот,черчение,математические знаки.Унифицированные системы (китайские и японские иероглифы;арабский,урду/шахмукхи,пегониволофал…) считаются за одну;греческийикоптскийдо версии 4.1, когда их разунифицировали,— тоже. При дальнейшем обновлении данных: файл PropertyValueAliases.txt, раздел «sc», количество строк в этом разделе минус три (последние три — технические). ↑Включаяпечатаемые (англ.graphic), управляющие (англ.control) и форматирующие (англ.format) символы;не включаяличные символы(англ.private-use), несимвольные позиции (англ.noncharacters), половинысуррогатных пар(англ.surrogate code points), неофициально занятые (U+1D548ажурноеℚ при официальном U+211A — используется, чтобы гарантированно набрать слово одним шрифтом; U+11C09бхайкшукиначальное слоговое LL — всанскритебуква есть, но не найдена в источниках именно письмом бхайкшуки). Пресс-релизы Юникода дают цифру на 65 меньше — не учитывают управляющие (00…1F, 7F…9F). Стоит признать, что категория этих символов поначалу несколько раз менялась. При дальнейшем обновлении данных: количество заявленных символов + 65.

Кодовое пространство

Хотя форма записи UTF-8 позволяет кодировать до 2²¹(2 097 152) кодовых позиций, было принято решение использовать лишь 1 112 064 для совместимости с UTF-16. Впрочем, даже и этого в данный момент более чем достаточно — в версии 15.1 используется всего 149 878 кодовых позиций.

Кодовое пространство разбито на 17плоскостей(англ.planes) по 2¹⁶(65 536) символов. Нулевая плоскость (plane 0) называетсябазовой(basic) и содержит символы наиболее употребительных письменностей. Остальные плоскости — дополнительные (supplementary). Первая плоскость (plane 1) используется в основном для исторических письменностей, вторая (plane 2) — для редко используемых иероглифовкитайского письма (ККЯ),третья (plane 3) зарезервирована для архаичных китайских иероглифов^[66].Плоскость 14 отведена для символов, используемых по особому назначению. Плоскости 15 и 16 выделены для частного употребления^[6].

Для обозначения символов Unicode используется запись вида «U+xxxx» (для кодов 0…FFFF), или «U+xxxxx» (для кодов 10000…FFFFF), или «U+xxxxxx» (для кодов 100000…10FFFF), гдеxxx—шестнадцатеричныецифры. Например, символ «я» (U+044F) имеет код 044F₁₆= 1103₁₀.

Плоскости Юникода
Плоскость	Название	Диапазон символов
0	Базовая многоязыковая плоскость(Basic Multilingual Plane, BMP)	U+0000…U+FFFF
1	Дополнительная многоязыковая плоскость(Supplementary Multilingual Plane, SMP)	U+10000…U+1FFFF
2	Дополнительная идеографическая плоскость(Supplementary Ideographic Plane, SIP)	U+20000…U+2FFFF
3	Третичная идеографическая плоскость(Tertiary Ideographic Plane, TIP)	U+30000…U+3FFFF
4—13	не используются	U+40000…U+DFFFF
14	Дополнительная специализированная плоскость(Supplementary Special-purpose Plane, SSP)	U+E0000…U+EFFFF
15—16	Дополнительные области для частного использования(Supplementary Private Use Area-A/B, SPUA-A/B)	U+F0000…U+10FFFF

Система кодирования

Универсальная система кодирования (Юникод) представляет собой набор графических символов и способ их кодирования длякомпьютернойобработки текстовых данных.

Графические или печатаемые символы — это символы, имеющие видимое изображение. Графическим символам противопоставляются управляющие и форматирующие символы.

Графические символы включают в себя следующие группы:

буквы, содержащиеся хотя бы в одном из обслуживаемыхалфавитов;
цифры;
знаки пунктуации;
специальные знаки (математические,технические,идеограммыи пр.);
разделители;
диакритические метки, включая невидимые.

Юникод — это система для линейного представления текста. Символы, имеющие дополнительные над- или подстрочные элементы, могут быть представлены в виде построенной по определённым правилам последовательности кодов (составной вариант, composite character) или в виде единого символа (монолитный вариант, precomposed character). С 2014 года считается, что все буквы крупных письменностей в Юникод внесены, и если символ доступен в составном варианте, дублировать его в монолитном виде не нужно.

Общие принципы

Гарантии стабильности: Как только символ появился в кодировке, он не сдвинется и не исчезнет. Таким образом, каждый новый Юникод будет надмножеством старого. Если символ окажется плохим, его запрещают. Если же потребуется изменить порядок символов, это делается не переменой позиций, а национальным порядком сортировки. Есть и другие, более тонкие гарантии стабильности — например, не будут меняться таблицы нормализации^[67].

Динамическая компоновка: Такой высокой цели, как универсальность, Юникод добивается путём динамической сборки печатного текста. Иногда для удобства делают и монолитные символы, но в целомA + ¨ = Ä.

Логический порядок: Символы в строке записываются приблизительно в порядке прочтения, в том числе в двунаправленном письме: арабский текст кодируется справа налево, а оказавшееся в нём европейское число — слева направо. Метка (умляут, огласовка…) идёт после основного символа. Есть исключения с визуальным порядком (например,лаосский).

Преобразуемость: Если в важной кодировке две формы одного символа закодированы разными позициями, это делает и Юникод. Преобразование не обязательно 1:1 — один символ другой кодировки может преобразоваться в несколько символов Юникода, и наоборот.

Простой текст: Юникод кодирует простой текст без оформления. Считается, что простой текст должен хранить достаточно данных, чтобы читаемо отобразить его, и больше ничего.

Семантика: Свойства символов задаются формально, с помощью форматовCSVиXML.

Символы, не глифы: Символ — единица смысла. Глиф — изображение, содержащееся в шрифте и выводящееся на экран/печать.

Так, в шрифте арабского стилянастали́кбудут тысячи глифов. Но в кодировке около 200 символов стандартного арабского, передающих смысл. И наоборот, иногда (см.Унификация) разные символы могут иметь одинаковый глиф.

Нарушение этого принципа или историческое (σ≠ς, существовало ещё до принципа динамической компоновки), или вызвано сложностями шрифтов (Ţ≠Ț, последнее используется вмолдавскомирумынском).

Универсальность: Юникод разработан для людей разных языков и профессий: работающих в бизнесе, образовании, религии и науке, для современных и исторических текстов.

За пределами Юникода лежат:

письменности, про которые мало что известно, чтобы надёжно закодировать символы;
письменности, чьи пользователи не пришли к де-факто стандарту;
нетекстовые (например, пиктографические) письменности.

Унификация: Юникод старается не дублировать символы. Так, английская буква «вай», французская «игрек» и немецкая «ипсилон» — одна и та же кодовая позицияY.Мало того, сходные иероглифы китайского и японского — одна кодовая позиция.

Существует несколько важных исключений. Сходные буквыразныхписьменностей кодируются разными кодовыми позициями. Часто позиции дублируются для упрощения обработки — так, в Юникоде три буквы Ð с разными строчными.Математический штрихи такой же штрих для индикациимягкости звуков— разные символы, второй считается буквой-модификатором. Преобразуемость может идти вразрез с унификацией — строчная греческаясигмаимеет две разных формы, и они — разные кодовые позиции.

Эффективность: Юникод устроен так, чтобы эффективные реализации были осуществимы. Коды символов — последовательные числа от 0 до 10FFFF₁₆,это позволяет иметь дело стаблицами поиска.UTF-8 и UTF-16 — самосинхронизирующиеся коды, а важнейшие символы доступны без раскодировки. Юникод избегает форматирующих символов, которые меняют внутреннее состояние. И многое другое.

Политика консорциума

Консорциум не создаёт нового, а констатирует сложившийся порядок вещей^[68].Например, картинки «эмодзи» были добавлены потому, что японские операторы мобильной связи широко их использовали. Для этого добавление символа проходит через сложный процесс^[68].И, например,символ российского рубляпрошёл его за три месяца, как только получил официальный статус, причём до этого он много лет де-факто использовался и его отказывались включить в Юникод.

Товарные знакикодируют только в порядке исключения. Так, в Юникоде нет флагаWindowsили яблокаApple.

Эмодзиневводятся в Юникод, если:^[69]

Понятие можно получить комбинацией имеющихся символов: «мыть руки» = «вода» + «руки».Белкучасто изображают картинкойбурундука.
Понятие слишком специфическое: если на картинке японского блюдасуширисуют, например, суши с креветкой, то не стоит запрашивать другие виды суши.
Понятие может вызвать волну новых добавлений.
Картинка содержит текст. Консорциум перестал включать такие эмодзи.
Картинка преходящая (например,вирус COVID-19). Некоторые производители рисуют вирус на месте эмодзи «микроорганизм».
Требуется закодировать конкретное изображение (например,интернет-мем).
Вариации направления движения: с Юникода 15.1 их понемногу вносят.

Комбинирующие метки

Представление символа «Й» (U+0419) в виде базового символа «И» (U+0418) и комбинирующей метки « ̆» (U+0306).

Символы в Юникоде подразделяются на базовые (англ.base characters) и комбинирующие (англ.combining marks). Метки обычно следуют за базовым символом и изменяют его отображение определённым образом. К комбинирующим символам, например, относятсядиакритические знаки,знаки ударения. Например, русскую букву «Й» в Юникоде можно записать в виде базового символа «И» (U+0418) и комбинирующего символа « ̆» (U+0306), отображаемого над базовым.

Комбинирующие символы помечены в таблицах символов Юникода особыми категориями:

Nonspacing Mark — непротяжённая метка; таковые обычно отображаются над или под базовым символом и крайне редко раздвигаюткегельную площадкусимвола (например,ï);
Enclosing Mark — охватывающая метка; эти метки охватывают символ со всех сторон и в идеале должны расширять его кегельную площадку;
Spacing Mark — протяжённая метка; представляет собой глиф перед или после основного символа, обладающий собственной кегельной площадкой.

Особый тип комбинирующих символов — селекторы варианта начертания (англ.variation selectors). Они действуют только на те базовые символы, для которых такие варианты определены. К примеру, в версии Юникода 5.0 варианты начертания определены для ряда математических символов, для символовтрадиционного монгольского алфавитаи для символовмонгольского квадратного письма.

Алгоритмы нормализации

Из-за наличия в Юникоде комбинирующих символов одни и те же знаки письменности можно представить различными кодами. Так, например, букву «Й» в примере выше можно записать как отдельным символом, так и сочетанием базового и комбинированного. Из-за этого сравнение строк байт за байтом становится невозможным. Алгоритмы нормализации (англ.normalization forms) решают эту проблему, выполняя приведение символов к определённому стандартному виду. Приведение осуществляется путём замены символов на эквивалентные с использованием таблиц и правил. «Декомпозицией» называется замена (разложение) одного символа на несколько составляющих символов, а «композицией», наоборот, — замена (соединение) нескольких составляющих символов на один символ.

В стандарте Юникода определены четыре алгоритма нормализации текста: NFD, NFC, NFKD и NFKC.

Каноническая декомпозиция (NFD)

NFD,англ.normalizationformD(«D» отангл.decomposition), форма нормализации D — каноническая декомпозиция — алгоритм, согласно которому выполняется рекурсивное разложение составных символов (англ.precomposed characters) на последовательность из одного или нескольких простых символов в соответствии с таблицами декомпозиции. Рекурсивное потому, что в процессе разложения составной символ может быть разложен на несколько других, некоторые из которых тоже являются составными, и к которым применяется дальнейшее разложение.

Примеры:

Ω
U+2126

→

Ω
U+03A9

Å
U+00C5

→

A
U+0041

̊
U+030A

ṩ
U+1E69

→

s
U+0073

̣
U+0323

̇
U+0307

ḍ̇
U+1E0B	U+0323

→

d
U+0064

̣
U+0323

̇
U+0307

q̣̇
U+0071	U+0307	U+0323

→

q
U+0071

̣
U+0323

̇
U+0307

Каноническая композиция (NFC)

NFC,англ.normalizationformC(«C» отангл.composition), форма нормализации C — алгоритм, согласно которому последовательно выполняются каноническая декомпозиция и каноническая композиция. Сначала каноническая декомпозиция (алгоритм NFD) приводит текст к форме D. Затем каноническая композиция — операция, обратная NFD, обрабатывает текст от начала к концу с учётом следующих правил:

символSсчитаетсяначальным,если имеет нулевой класс комбинируемости (англ.combining class of zero) согласно таблице символов Юникода;
в любой последовательности символов, начинающейся с символаS,символCблокируется отS,только если междуSиCесть какой-либо символB,который либо является начальным, либо имеет одинаковый или больший класс комбинируемости, чемC.Это правило распространяется только на строки, прошедшие каноническую декомпозицию;
символ считаетсяпервичнымкомпозитом, если имеет каноническую декомпозицию в таблице символов Юникода (или каноническую декомпозицию дляхангыляи он не входит всписок исключений);
символXможет быть первично совмещён с символомY,если и только если существует первичный композитZ,канонически эквивалентный последовательности <X,Y>;
если очередной символCне блокируется последним встреченным начальным базовым символомLи он может быть успешно первично совмещён с ним, тоLзаменяется на композитL-C,аCудаляется.

Пример:

o
U+006F

̂
U+0302

→

ô
U+00F4

Совместимая декомпозиция (NFKD)

NFKD,англ.normalizationformKD,форма нормализации KD — совместимая декомпозиция — алгоритм, согласно которому последовательно выполняются каноническая декомпозиция и замены символов текста по таблицам совместимой декомпозиции. Таблицы совместимой декомпозиции предусматривают замену на почти эквивалентные символы^[70]:

похожих на буквы (ℍ и ℌ);
обведённых кружками (①);
с изменёнными размерами (ｶ и カ);
повёрнутых (︷ и {);
степеней (⁹ и ₉);
дробей (¼);
других (™).

Примеры:

ℍ
U+210D

→

H
U+0048

①
U+2460

→

1
U+0031

ｶ
U+FF76

→

カ
U+30AB

︷
U+FE37

→

{
U+007B

⁹
U+2079

→

9
U+0039

¼
U+00BC

→

1	⁄	4
U+0031	U+2044	U+0034

™
U+2122

→

T	M
U+0054	U+004D

Совместимая композиция (NFKC)

NFKC,англ.normalizationformKC,форма нормализации KC — алгоритм, согласно которому последовательно выполняются совместимая декомпозиция (алгоритм NFKD) иканоническаякомпозиция (алгоритм NFC).

Примеры

Исходный текст

NFD

NFC

NFKD

NFKC

ﬁ
U+FB01

ﬁ
U+FB01

ﬁ
U+FB01

f	i
U+0066	U+0069

f	i
U+0066	U+0069

2	⁵
U+0032	U+2075

2	⁵
U+0032	U+2075

2	⁵
U+0032	U+2075

2	5
U+0032	U+0035

2	5
U+0032	U+0035

ẛ̣
U+1E9B	U+0323

ſ	̣	̇
U+017F	U+0323	U+0307

ẛ	̣
U+1E9B	U+0323

s	̣	̇
U+0073	U+0323	U+0307

ṩ
U+1E69

й
U+0439

и	̆
U+0438	U+0306

й
U+0439

и	̆
U+0438	U+0306

й
U+0439

ё
U+0451

е	̈
U+0435	U+0308

ё
U+0451

е	̈
U+0435	U+0308

ё
U+0451

А
U+0410

А
U+0410

А
U+0410

А
U+0410

А
U+0410

が
U+304C

か	゙
U+304B	U+3099

が
U+304C

か	゙
U+304B	U+3099

が
U+304C

Ⅷ
U+2167

Ⅷ
U+2167

Ⅷ
U+2167

V	I	I	I
U+0056	U+0049	U+0049	U+0049

V	I	I	I
U+0056	U+0049	U+0049	U+0049

ç
U+00E7

c	̧
U+0063	U+0327

ç
U+00E7

c	̧
U+0063	U+0327

ç
U+00E7

Двунаправленное письмо

Стандарт Юникод поддерживает письменности языков как с направлением написания слева направо (англ.left-to-right, LTR), так и с написанием справа налево (англ.right-to-left, RTL) — например,арабскоеиеврейскоеписьмо. В обоих случаях символы хранятся в «естественном» порядке; их отображение с учётом нужного направления письма обеспечивается приложением.

Кроме того, Юникод поддерживает комбинированные тексты, сочетающие фрагменты с разным направлением письма. Данная возможность называетсядвунаправленность(англ.bidirectional text, BiDi). Некоторые упрощённые обработчики текста (например, в сотовых телефонах) могут поддерживать Юникод, но не иметь поддержки двунаправленности. Все символы Юникода поделены на несколько категорий: пишущиеся слева направо, пишущиеся справа налево, и пишущиеся в любом направлении. Символы последней категории (в основном этознаки пунктуации) при отображении принимают направление окружающего их текста.

Представленные символы

Юникод включает практически все современныеписьменности,в том числе:

арабскую,
армянскую,
бенгальскую,
бирманскую,
глаголицу,
греческую,
грузинскую,
деванагари,
еврейскую,
кириллицу,
китайскую(китайские иероглифы активно используются вяпонском языке,а также изредка вкорейском),
коптскую,
кхмерскую,
латинскую,
тамильскую,
корейскую (хангыль),
чероки,
эфиопскую,
японскую(которая включает в себя, кромеслоговой азбуки,ещё икитайские иероглифы)

и другие.

С академическими целями добавлены многие исторические письменности, в том числе:германские руны,древнетюркские руны,древнегреческая письменность,египетские иероглифы,клинопись,письменность майя,этрусский алфавит.

В Юникоде представлен широкий наборматематическихимузыкальныхсимволов, а такжепиктограмм.

Государственные флагине включены в Юникод напрямую. Для их кодирования используются пары из 26 буквенных символов, предназначенных для представления двухбуквенных кодов стран по стандартуISO 3166-1 alpha-2.Эти буквы закодированы в диапазоне отU+1F1E6🇦regional indicator symbol letter a(HTML🇦) доU+1F1FF🇿regional indicator symbol letter z(HTML🇿).

В Юникод принципиально не включаютсялоготипыкомпаний и продуктов, хотя они и встречаются в шрифтах (например, логотипAppleв кодировкеMacRoman(0xF0) или логотипWindowsв шрифте Wingdings (0xFF)). В юникодовских шрифтах логотипы должны размещаться только в области пользовательских символов. Существуют свободные бесплатные шрифты, включающие в себя логотипы компаний, программных продуктов и другие товарные знаки (например,Шрифт Awesome^[англ.]^[71]).

ISO/IEC 10646

Консорциум Юникода работает в тесной связи с рабочей группой ISO/IEC/JTC1/SC2/WG2, которая занимается разработкой международного стандарта 10646 (ISO/IEC10646). Между стандартом Юникода и ISO/IEC 10646 установлена синхронизация, хотя каждый стандарт использует свою терминологию и систему документации.

Сотрудничество Консорциума Юникода с Международной организацией по стандартизации (англ.International Organization for Standardization, ISO) началось в1991 году.В1993 годуISO выпустила стандарт DIS 10646.1. Для синхронизации с ним Консорциум утвердил стандарт Юникода версии 1.1, в который были внесены дополнительные символы из DIS 10646.1. В результате значения закодированных символов в Unicode 1.1 и DIS 10646.1 полностью совпали.

В дальнейшем сотрудничество двух организаций продолжилось. В 2000 году стандарт Unicode 3.0 был синхронизирован с ISO/IEC 10646-1:2000. Предстоящая третья версия ISO/IEC 10646 будет синхронизирована с Unicode 4.0. Возможно, эти спецификации даже будут опубликованы как единый стандарт.

Аналогично форматам UTF-16 и UTF-32 в стандарте Юникода, стандарт ISO/IEC 10646 также имеет две основные формы кодирования символов: UCS-2 (2 байта на символ, аналогично UTF-16) и UCS-4 (4 байта на символ, аналогично UTF-32). UCS значитуниверсальный набор кодированных символов(англ.universal coded character set). UCS-2 можно считать подмножеством UTF-16 (UTF-16 без суррогатных пар), а UCS-4 является синонимом для UTF-32.

Различия стандартов Юникод и ISO/IEC 10646:

небольшие различия в терминологии;
ISO/IEC 10646 не включает разделы, необходимые для полноценной реализации поддержки Юникода:
- нет данных о двоичном кодировании символов;
- нет описания алгоритмов сравнения (англ.collation) и отрисовки (англ.rendering) символов;
- нет перечня свойств символов (например, нет перечня свойств, необходимых для реализации поддержки двунаправленного (англ.bi-directional) письма).

Способы представления

Юникод имеет несколько форм представления (англ.Unicode transformation format, UTF):UTF-8,UTF-16(UTF-16BE, UTF-16LE) иUTF-32(UTF-32BE, UTF-32LE). Была разработана также форма представленияUTF-7для передачи по семибитным каналам, но из-за несовместимости сASCIIона не получила распространения и не включена в стандарт. 1 апреля 2005 года были предложены двешуточныеформы представления: UTF-9 и UTF-18 (RFC 4042).

ВMicrosoft Windows NTи основанных на ней системахWindows 2000иWindows XPв основномиспользуетсяформа UTF-16LE. ВUNIX-подобныхоперационных системах GNU/Linux,BSDиMac OS Xпринята форма UTF-8 для файлов и UTF-32 или UTF-8 для обработки символов воперативной памяти.

Punycode— другая форма кодирования последовательностей Unicode-символов в так называемые ACE-последовательности, которые состоят только из алфавитно-цифровых символов, как это разрешено в доменных именах.

UTF-8

UTF-8 — представление Юникода, обеспечивающее наибольшую компактность и обратную совместимость с 7-битной системойASCII;текст, состоящий только из символов с номерами меньше 128, при записи в UTF-8 превращается в обычный текстASCIIи может быть отображён любой программой, работающей с ASCII; и наоборот, текст, закодированный 7-битной ASCII может быть отображён программой, предназначенной для работы с UTF-8. Остальные символы Юникода изображаются последовательностями длиной от 2 до 4 байт, в которых первый байт всегда имеет маску11xxxxxx,а остальные —10xxxxxx.В UTF-8 не используются суррогатные пары.

Формат UTF-8 был изобретён2 сентября 1992 года Кеном ТомпсономиРобом Пайкоми реализован в ОСPlan 9^[72].Сейчас стандарт UTF-8 официально закреплён в документахRFC 3629и ISO/IEC 10646 Annex D.

UTF-16 и UTF-32

UTF-16 — кодировка, позволяющая записывать символы Юникода в диапазонах U+0000…U+D7FF и U+E000…U+10FFFF (общим количеством 1 112 064). При этом каждый символ записывается одним или двумя словами (суррогатная пара). Кодировка UTF-16 описана в приложении Q к международному стандарту ISO/IEC 10646, а также ей посвящён документ IETFRFC 2781под названием «UTF-16, an encoding of ISO 10646».

UTF-32 — способ представления Юникода, при котором каждый символ занимает ровно 4 байта. Главное преимущество UTF-32 перед кодировками переменной длины заключается в том, что символы Юникод в ней непосредственно индексируемы, поэтому найти символ по номеру его позиции в файле можно чрезвычайно быстро, и получение любого символаn-й позиции при этом является операцией, занимающей всегда одинаковое время. Это также делает замену символов в строках UTF-32 очень простой. Напротив, кодировки с переменной длиной требуют последовательного доступа к символуn-й позиции, что может быть очень затратной по времени операцией. Главный недостаток UTF-32 — это неэффективное использование пространства, так как для хранения любого символа используется четыре байта. Символы, лежащие за пределами нулевой (базовой) плоскости кодового пространства, редко используются в большинстве текстов. Поэтому удвоение, в сравнении с UTF-16, занимаемого строками в UTF-32 пространства, зачастую не оправдано.

Порядок байтов

В потоке данных UTF-16 младший байт может записываться либо перед старшим (англ.UTF-16 little-endian, UTF-16LE), либо после старшего (англ.UTF-16 big-endian, UTF-16BE). Аналогично существует два варианта четырёхбайтной кодировки — UTF-32LE и UTF-32BE.

Маркер последовательности байтов

Для указания на использование Юникода, в начале текстового файла или потока может передаватьсяМаркер последовательности байтов(англ.byte order mark (BOM)) — символ U+FEFF (неразрывный пробел нулевой ширины). По его виду можно легко различить как формат представления Юникода, так и последовательность байтов. Маркер последовательности байтов может принимать следующий вид:

UTF-8: EF BB BF
UTF-16BE: FE FF
UTF-16LE: FF FE
UTF-32BE: 00 00 FE FF
UTF-32LE: FF FE 00 00

Юникод и традиционные кодировки

Внедрение Юникода привело к изменению подхода к традиционным 8-битным кодировкам. Если раньше такая кодировка всегда задавалась непосредственно, то теперь она может задаваться таблицей соответствия между данной кодировкой и Юникодом. Фактически почти все 8-битные кодировки теперь можно рассматривать как форму представления некоторого подмножества Юникода. И это намного упростило создание программ, которые должны работать с множеством разных кодировок: теперь, чтобы добавить поддержку ещё одной кодировки, надо всего лишь добавить ещё одну таблицу перекодировки символов в Юникод.

Кроме того, многие форматы данных позволяют вставлять любые символы Юникода, даже если документ записан в старой 8-битной кодировке. Например, в HTML можно использоватькоды с амперсандом.

Реализации

Большинство современных операционных систем в той или иной степени обеспечивает поддержку Юникода.

В операционных системах семействаWindows NTдля внутреннего представления имён файлов и других системных строк используется двухбайтовая кодировка UTF-16LE. Системные вызовы, принимающие строковые параметры, существуют в однобайтном и двухбайтном вариантах. Подробнее см. в статьеЮникод в операционных системах семейства Microsoft Windows.

UNIX-подобные операционные системы, в том числеGNU/Linux,BSD,OS X,используют для представления Юникода кодировку UTF-8. Большинство программ может работать с UTF-8 как с традиционными однобайтными кодировками, не обращая внимания на то, что символ представляется как несколько последовательных байт. Для работы с отдельными символами строки обычно перекодируются в UCS-4, так что каждому символу соответствуетмашинное слово.

Одной из первых успешных коммерческих реализаций Юникода стала среда программированияJava.В ней принципиально отказались от 8-битного представления символов в пользу 16-битного. Это решение увеличило расход памяти, но позволило вернуть в программирование важную абстракцию: произвольный одиночный символ (типchar). В частности, программист мог работать со строкой, как с простым массивом. Успех не был окончательным, Юникод перерос ограничение в 16 бит и к версии J2SE 5.0 произвольный символ снова стал занимать переменное число единиц памяти — одинcharили два (см.суррогатная пара).

Сейчас^{[когда?]}большинство^{[сколько?]}языков программирования поддерживает строки Юникода, хотя их представление может различаться в зависимости от реализации.

Методы ввода

Поскольку ни однараскладка клавиатурыне может позволить вводить все символы Юникода одновременно, отоперационных системиприкладных программтребуется поддержка альтернативных методов ввода произвольных символов Юникода.

Microsoft Windows

Начиная сWindows 2000,служебная программа «Таблица символов» (charmap.exe) поддерживает символы Юникода и позволяет копировать их вбуфер обмена.Реализована поддержка только базовой плоскости (коды символов U+0000…U+FFFF); символы с кодами от U+10000 «Таблица символов» не отображает. Похожая таблица есть вMicrosoft Word.

Иногда можно набратьшестнадцатеричныйкод, нажатьAlt+X,и код будет заменён на соответствующий символ, например, вWordPad,Microsoft Word. В редакторахAlt+Xвыполняет и обратное преобразование. В программах, работающих в среде Windows, чтобы получить символ Unicode, нужнопри нажатой клавише Altнабрать десятичное значение кода символа на цифровой клавиатуре: например, комбинации Alt+0171 и Alt+0187 выводят левую и правуюкавычки-ёлочки,соответственно, Alt+0151 — длинное тире, Alt+0769 —знак ударения,Alt+0133 — многоточие и пр.

Macintosh

ВMac OS8.5 и более поздних версиях поддерживается метод ввода, называемый «Unicode Hex Input». При зажатой клавише Option требуется набрать четырёхзначный шестнадцатеричный код требуемого символа. Этот метод позволяет вводить символы с кодами, большими U+FFFD, используя пары суррогатов; такие пары операционной системой будут автоматически заменены на одиночные символы. Этот метод ввода перед использованием нужно активизировать в соответствующем разделе системных настроек и затем выбрать как текущий метод ввода в меню клавиатуры.

Начиная сMac OS X10.2, существует также приложение «Character Palette», позволяющее выбирать символы из таблицы, в которой можно выделять символы определённого блока или символы, поддерживаемые конкретным шрифтом.

GNU/Linux

ВGNOMEтакже есть утилита «Таблица символов» (ранее gucharmap), позволяющая отображать символы определённого блока или системы письма и предоставляющая возможность поиска по названию или описанию символа. Когда код нужного символа известен, его можно ввести в соответствии со стандартомISO14755: при зажатых клавишахCtrl+⇧ Shiftввести шестнадцатеричный код (начиная с некоторой версии GTK+, ввод кода нужно предварить нажатием клавиши«U»). Вводимый шестнадцатеричный код может иметь до 32битв длину, позволяя вводить любые символы Юникода без использования суррогатных пар.

Все приложенияX Window,включая GNOME иKDE,поддерживают ввод при помощи клавишиCompose.Для клавиатур, на которых нет отдельной клавишиCompose,для этой цели можно назначить любую клавишу — например,⇪Caps Lock.

Консоль GNU/Linux также допускает ввод символа Юникода по его коду — для этого десятичный код символа нужно ввести цифрами расширенного блока клавиатуры при зажатой клавишеAlt.Можно вводить символы и по их шестнадцатеричному коду: для этого нужно зажать клавишуAltGr,и для ввода цифр A—F использовать клавиши расширенного блока клавиатуры отNumLockдо↵ Enter(по часовой стрелке). Поддерживается также и ввод в соответствии с ISO 14755. Для того чтобы перечисленные способы могли работать, нужно включить в консоли режим Юникода вызовомunicode_start(1) и выбрать подходящий шрифт вызовомsetfont(8).

Mozilla Firefoxдля Linux поддерживает ввод символов по ISO 14755.

Проблемы Юникода

В Юникоде английское «a» и польское «a» — один и тот же символ. Точно так же одним и тем же символом (но отличающимся от «a» латинского) считаются русское «а» и сербское «а». Такой принцип кодирования не универсален; по-видимому, решения «на все случаи жизни» вообще не может существовать.

Тексты накитайском,корейскомияпонскомязыках имеют традиционное написание сверху вниз, начиная с правого верхнего угла. Переключение горизонтального и вертикального написания для этих языков не предусмотрено в Юникоде — это должно осуществляться средствамиязыков разметкиили внутренними механизмамитекстовых процессоров.
Наличие или отсутствие в Юникоде разных начертаний одного и того же символа в зависимости от языка. Нужно следить, чтобы текст всегда был правильно помечен как относящийся к тому или другому языку.
Так,китайские иероглифымогут иметь разные начертания в китайском, японском (кандзи) и корейском (ханча), но при этом в Юникоде обозначаются одним и тем же символом (так называемая ККЯ-унификация), хотя упрощённые и полные иероглифы всё же имеют разные коды.

Аналогично,русскийисербский языкииспользуют разное начертание курсивных буквпит(в сербском они выглядят какп(и̅) ит(ш̅), см.сербский курсив).
Перевод из строчных букв в заглавные тоже зависит от языка. Например: втурецкомсуществуют буквыİi и Iı— таким образом, турецкие правила изменения регистра конфликтуют санглийскими,которые предписывают «i» переводить в «I». Подобные проблемы есть и в других языках — например, в канадском диалекте французского языка регистр переводится немного не так, как во Франции^[73].
Даже сарабскими цифрамиесть определённые типографские тонкости: цифры бывают «прописными» и «строчными», пропорциональными имоноширинными^[74]— для Юникода разницы между ними нет. Подобные нюансы остаются за программным обеспечением.

Некоторые недостатки связаны не с самим Юникодом, а с возможностями обработчиков текста.

Файлы нелатинского текста в Юникоде всегда занимают больше места, так как один символ кодируется не одним байтом, как в различных национальных кодировках, а последовательностью байтов (исключение составляет UTF-8 для языков, алфавит которых укладывается в ASCII, а также наличие в тексте символов двух и более языков, алфавит которыхнеукладывается в ASCII^[75]). Файл шрифта всех символов таблицы Юникод занимает сравнительно много места в памяти и требует бо́льших вычислительных ресурсов, чем шрифт только одного национального языка пользователя^[76].С увеличением мощности компьютерных систем и удешевлением памяти и дискового пространства эта проблема становится всё менее существенной; тем не менее, она остаётся актуальной для портативных устройств, например, для мобильных телефонов.
Хотя поддержка Юникода реализована в наиболее распространённых операционных системах, до сих пор не всё прикладное программное обеспечение поддерживает корректную работу с ним. В частности, не всегда обрабатываются метки порядка байтов (BOM) и плохо поддерживаютсядиакритические символы.Проблема является временной и есть следствие сравнительной новизны стандартов Юникода (в сравнении с однобайтовыми национальными кодировками).
Производительность всех программ обработки строк (в том числе и сортировок в БД) снижается при использовании Юникода вместо однобайтовых кодировок.

Некоторые редкие системы письма всё ещё не представлены должным образом в Юникоде. Изображение «длинных» надстрочных символов, простирающихся над несколькими буквами, как, например, вцерковнославянском языке,пока не реализовано.

Написание слова «Unicode»

«Unicode» — одновременно и имя собственное (или часть имени, например, Unicode Consortium), и имя нарицательное, происходящее из английского языка.

На первый взгляд предпочтительнее использовать написание «Уникод». Врусском языкеуже естьморфемы«уни-» (слова с латинским элементом «uni-» традиционно переводились и писались через «уни-»: универсальный, униполярный, унификация, униформа) и «код». Напротив, торговые марки, заимствованные изанглийского языка,обычно передаются посредством практической транскрипции, в которой деэтимологизированное сочетание букв «uni-» записывается в виде «юни-» («Юнилевер», «Юникс» и т. п.), то есть точно так же, как в случае с побуквенными сокращениями, вродеUNICEF«United Nations International Children’s Emergency Fund» —ЮНИСЕФ.

На сайте Консорциума есть специальная страница, где рассматриваются проблемы передачи слова «Unicode» в различных языках и системах письма. Для русской кириллицы указан вариант «Юникод»^[1].ВMS Windowsтакже используется вариант «Юникод».

ВВикипедии на русском языкеиспользуется вариант «Юникод» как наиболее распространённый.

См. также

Примечания

↑¹ ²Unicode Transcriptions(англ.).Дата обращения: 10 мая 2010. Архивировано изоригинала8 апреля 2006 года.
↑The Unicode® Standard: A Technical Introduction(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала10 марта 2010 года.
↑History of Unicode Release and Publication Dates(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала10 января 2010 года.
↑The Unicode Consortium(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала27 июня 2010 года.
↑¹ ² ³Foreword(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала27 июня 2010 года.
↑¹ ²General Structure(неопр.).Дата обращения: 5 июля 2010. Архивировано изоригинала27 июня 2010 года.
↑European Alphabetic Scripts(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала27 июня 2010 года.
↑Что такое Unicode?(неопр.)Дата обращения: 15 февраля 2006.Архивировано13 февраля 2006 года.
↑Unicode 88(неопр.).Дата обращения: 8 июля 2010. Архивировано изоригинала6 сентября 2017 года.
↑Unicode and Microsoft Windows NT(англ.).Microsoft Support.Дата обращения: 12 ноября 2009. Архивировано изоригинала26 сентября 2009 года.
↑Unicode используется почти на 50% веб-сайтов(рус.).Дата обращения: 9 февраля 2010. Архивировано изоригинала11 июня 2010 года.
↑https://www.unicode.org/versions/Unicode15.1.0/
↑History of Unicode Release and Publication Dates(неопр.).Дата обращения: 3 июля 2010.Архивировано10 января 2010 года.
↑Enumerated Versions(неопр.).Дата обращения: 2 июля 2017.Архивировано25 декабря 2018 года.
↑About Versions(неопр.).Дата обращения: 2 июля 2017.Архивировано16 июля 2017 года.
↑Unicode® 1.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано13 декабря 2017 года.
↑Unicode Data 1.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано30 июня 2012 года.
↑Unicode Data 1.0.1(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode® 1.1(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано13 декабря 2017 года.
↑Unicode Data 1995(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 2.0.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано8 июля 2017 года.
↑Unicode Data 2.0.14(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 2.1.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано2 января 2015 года.
↑Unicode Data 2.1.2(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 3.0.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано7 июля 2017 года.
↑Unicode Data 3.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 3.1.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано7 июля 2017 года.
↑Unicode Data 3.1.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 3.2.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано14 июля 2017 года.
↑Unicode Data 3.2.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 4.0.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано14 июля 2017 года.
↑Unicode Data 4.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 4.1.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано25 мая 2021 года.
↑Unicode Data 4.1.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 5.0.0(англ.).Unicode Consortium^[англ.](14 июля 2006). Дата обращения: 8 декабря 2017.Архивировано10 июня 2008 года.
↑Unicode Data 5.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode 5.1.0(англ.).Unicode Consortium^[англ.](4 апреля 2008). Дата обращения: 8 декабря 2017.Архивировано10 апреля 2010 года.
↑Unicode Data 5.1.0(англ.).Дата обращения: 4 декабря 2017.Архивировано19 апреля 2022 года.
↑Unicode® 5.2.0(англ.).Unicode Consortium^[англ.](1 октября 2009). Дата обращения: 8 декабря 2017.Архивировано8 ноября 2017 года.
↑Unicode Data 5.2.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode® 6.0.0(англ.).Unicode Consortium^[англ.](11 октября 2010). Дата обращения: 8 декабря 2017.Архивировано8 февраля 2013 года.
↑Unicode Data 6.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.
↑Unicode® 6.1.0(англ.).Unicode Consortium^[англ.](31 января 2012). Дата обращения: 8 декабря 2017.Архивировано15 июля 2017 года.
↑Unicode Data 6.1.0(англ.).Дата обращения: 4 декабря 2017.Архивировано26 марта 2022 года.
↑Unicode® 6.2.0(англ.).Unicode Consortium^[англ.](26 сентября 2012). Дата обращения: 7 декабря 2017.Архивировано12 февраля 2019 года.
↑Unicode Data 6.2.0(англ.).Дата обращения: 4 декабря 2017.Архивировано26 марта 2022 года.
↑Unicode® 6.3.0(англ.).Unicode Consortium^[англ.](30 сентября 2012). Дата обращения: 7 декабря 2017.Архивировано15 июля 2017 года.
↑Unicode Data 6.3.0(англ.).Дата обращения: 4 декабря 2017.Архивировано7 апреля 2022 года.
↑Unicode® 7.0.0(англ.).Unicode Consortium^[англ.](16 июня 2014). Дата обращения: 8 декабря 2017.Архивировано15 апреля 2019 года.
↑Unicode Data 7.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано7 апреля 2022 года.
↑Unicode® 8.0.0(англ.).Unicode Consortium^[англ.](17 июня 2015). Дата обращения: 8 декабря 2017.Архивировано28 июня 2016 года.
↑Unicode Data 8.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано24 марта 2021 года.
↑Unicode® 9.0.0(англ.).Unicode Consortium^[англ.](21 июня 2016). Дата обращения: 8 декабря 2017.Архивировано28 февраля 2020 года.
↑Unicode Data 9.0.0(англ.).Дата обращения: 6 декабря 2017.Архивировано7 апреля 2022 года.
↑Unicode® 10.0.0(англ.).Unicode Consortium^[англ.](27 июня 2017). Дата обращения: 8 декабря 2017.Архивировано20 июня 2017 года.
↑Unicode Data 10.0.0(англ.).Дата обращения: 7 декабря 2017.Архивировано21 ноября 2021 года.
↑Unicode Data 11.0.0(англ.).Дата обращения: 12 апреля 2019.Архивировано8 апреля 2022 года.
↑The Unicode Blog: Announcing The Unicode® Standard, Version 11.0(неопр.).Дата обращения: 5 июня 2019.Архивировано22 июля 2019 года.
↑Unicode 11.0.0(неопр.).Дата обращения: 5 июня 2019.Архивировано30 марта 2021 года.
↑The Unicode Blog: Announcing The Unicode® Standard, Version 12.0(неопр.).Дата обращения: 5 июня 2019.Архивировано3 июня 2019 года.
↑Unicode 12.0.0(неопр.).Дата обращения: 5 июня 2019.Архивировано30 марта 2021 года.
↑The Unicode Blog: Unicode Version 12.1 released in support of the Reiwa Era(неопр.).Дата обращения: 5 июня 2019.Архивировано7 мая 2019 года.
↑Unicode 12.1.0(неопр.).Дата обращения: 5 июня 2019.Архивировано8 июня 2019 года.
↑The Unicode Blog: Announcing The Unicode Standard, Version 13.0(неопр.).Дата обращения: 15 мая 2020.Архивировано26 апреля 2022 года.
↑Unicode 13.0.0(неопр.).Дата обращения: 15 мая 2020.Архивировано30 марта 2021 года.
↑Roadmap to the TIP (Tertiary Ideographic Plane)(неопр.).Дата обращения: 12 октября 2010.Архивировано29 февраля 2020 года.
↑Unicode Character Encoding Stability Policy(неопр.).Дата обращения: 2 мая 2014.Архивировано15 августа 2012 года.
↑¹ ²FAQ — Emoji & Dingbats(неопр.).Дата обращения: 2 мая 2014.Архивировано29 апреля 2014 года.
↑Guidelines for Submitting Unicode® Emoji Proposals(неопр.).Дата обращения: 10 июня 2021.Архивировано6 июня 2021 года.
↑Нормализация Unicode(неопр.).Дата обращения: 4 августа 2014.Архивировано8 августа 2014 года.
↑GitHub — FortAwesome/Font-Awesome: The iconic SVG, font, and CSS toolkit(неопр.).Дата обращения: 27 июня 2020.Архивировано27 июня 2020 года.
↑Архивированная копия(неопр.).Дата обращения: 27 февраля 2007. Архивировано изоригинала29 октября 2006 года.(англ.)
↑Регистр в Unicode — это непросто(неопр.).Дата обращения: 9 апреля 2011.Архивировано23 апреля 2014 года.
↑В большинстве шрифтов для ПК реализованы «прописные» (маюскульные) моноширинные цифры.
↑В некоторых случаях документ (не простой текст) в Юникоде может занимать существенно меньше места, чем документ в однобайтовой кодировке. Например, если некая веб-страница содержит примерно поровну русского и греческого текста, то в однобайтовой кодировке придётся либо русские, либо греческие буквы записывать, используя возможности формата документов, в виде кодов с амперсандом, которые занимают 6—7 байт на символ (при использовании десятичных кодов), то есть в среднем на букву придётся 3,5—4 байта, в то время как UTF-8 занимает только 2 байта на греческую или русскую букву.
↑Один из файлов шрифтов Arial Unicode имеет размер 24 мегабайта; существует Times New Roman размером 120 мегабайт, он содержит количество символов, близкое к 65536.

Ссылки

Официальный сайт Консорциума Юникода(англ.)
Таблица символов Юникода с названиями, поиск по символам(рус.)(англ.)
Последняя версия стандарта Юникод(англ.)
Связь Юникода версии 5.0.0 и ISO/IEC 10646(файл PDF)(англ.)
FAQ по UTF-8 и Unicode(англ.)

[16] Включаяединственный код (шрифт Брайля), единственную стенографическую систему (стенография Дюплойе), а такжекатакану,хирагану,жестовое письмо Саттон,исключаяхэнтайгану(считается хираганой), два альтернативных грузинских алфавита (считаютсягрузинским), а также другие нетекстовые: четыре виданот,черчение,математические знаки.Унифицированные системы (китайские и японские иероглифы;арабский,урду/шахмукхи,пегониволофал…) считаются за одну;греческийикоптскийдо версии 4.1, когда их разунифицировали,— тоже. При дальнейшем обновлении данных: файл PropertyValueAliases.txt, раздел «sc», количество строк в этом разделе минус три (последние три — технические).

[17] Включаяпечатаемые (англ.graphic), управляющие (англ.control) и форматирующие (англ.format) символы;не включаяличные символы(англ.private-use), несимвольные позиции (англ.noncharacters), половинысуррогатных пар(англ.surrogate code points), неофициально занятые (U+1D548ажурноеℚ при официальном U+211A — используется, чтобы гарантированно набрать слово одним шрифтом; U+11C09бхайкшукиначальное слоговое LL — всанскритебуква есть, но не найдена в источниках именно письмом бхайкшуки). Пресс-релизы Юникода дают цифру на 65 меньше — не учитывают управляющие (00…1F, 7F…9F). Стоит признать, что категория этих символов поначалу несколько раз менялась. При дальнейшем обновлении данных: количество заявленных символов + 65.

[autogenerated1-1] ¹ ²Unicode Transcriptions(англ.).Дата обращения: 10 мая 2010. Архивировано изоригинала8 апреля 2006 года.

[unicode-techintro-2] The Unicode® Standard: A Technical Introduction(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала10 марта 2010 года.

[3] History of Unicode Release and Publication Dates(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала10 января 2010 года.

[4] The Unicode Consortium(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала27 июня 2010 года.

[unicode-foreword-5] ¹ ² ³Foreword(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала27 июня 2010 года.

[unicode-02-6] ¹ ²General Structure(неопр.).Дата обращения: 5 июля 2010. Архивировано изоригинала27 июня 2010 года.

[7] European Alphabetic Scripts(неопр.).Дата обращения: 4 июля 2010. Архивировано изоригинала27 июня 2010 года.

[8] Что такое Unicode?(неопр.)Дата обращения: 15 февраля 2006.Архивировано13 февраля 2006 года.

[9] Unicode 88(неопр.).Дата обращения: 8 июля 2010. Архивировано изоригинала6 сентября 2017 года.

[windows-nt-10] Unicode and Microsoft Windows NT(англ.).Microsoft Support.Дата обращения: 12 ноября 2009. Архивировано изоригинала26 сентября 2009 года.

[11] Unicode используется почти на 50% веб-сайтов(рус.).Дата обращения: 9 февраля 2010. Архивировано изоригинала11 июня 2010 года.

[_d7007d007e0c35a7-12] ttps://www.unicode.org/versions/Unicode15.1.0/

[13] History of Unicode Release and Publication Dates(неопр.).Дата обращения: 3 июля 2010.Архивировано10 января 2010 года.

[14] Enumerated Versions(неопр.).Дата обращения: 2 июля 2017.Архивировано25 декабря 2018 года.

[15] About Versions(неопр.).Дата обращения: 2 июля 2017.Архивировано16 июля 2017 года.

[18] Unicode® 1.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано13 декабря 2017 года.

[19] Unicode Data 1.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано30 июня 2012 года.

[20] Unicode Data 1.0.1(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[21] Unicode® 1.1(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано13 декабря 2017 года.

[22] Unicode Data 1995(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[23] Unicode 2.0.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано8 июля 2017 года.

[24] Unicode Data 2.0.14(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[25] Unicode 2.1.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано2 января 2015 года.

[26] Unicode Data 2.1.2(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[27] Unicode 3.0.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано7 июля 2017 года.

[28] Unicode Data 3.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[29] Unicode 3.1.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано7 июля 2017 года.

[30] Unicode Data 3.1.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[31] Unicode 3.2.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано14 июля 2017 года.

[32] Unicode Data 3.2.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[33] Unicode 4.0.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано14 июля 2017 года.

[34] Unicode Data 4.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[35] Unicode 4.1.0(англ.).Unicode Consortium^[англ.].Дата обращения: 8 декабря 2017.Архивировано25 мая 2021 года.

[36] Unicode Data 4.1.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[37] Unicode 5.0.0(англ.).Unicode Consortium^[англ.](14 июля 2006). Дата обращения: 8 декабря 2017.Архивировано10 июня 2008 года.

[38] Unicode Data 5.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[39] Unicode 5.1.0(англ.).Unicode Consortium^[англ.](4 апреля 2008). Дата обращения: 8 декабря 2017.Архивировано10 апреля 2010 года.

[40] Unicode Data 5.1.0(англ.).Дата обращения: 4 декабря 2017.Архивировано19 апреля 2022 года.

[41] Unicode® 5.2.0(англ.).Unicode Consortium^[англ.](1 октября 2009). Дата обращения: 8 декабря 2017.Архивировано8 ноября 2017 года.

[42] Unicode Data 5.2.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[43] Unicode® 6.0.0(англ.).Unicode Consortium^[англ.](11 октября 2010). Дата обращения: 8 декабря 2017.Архивировано8 февраля 2013 года.

[44] Unicode Data 6.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано21 марта 2022 года.

[45] Unicode® 6.1.0(англ.).Unicode Consortium^[англ.](31 января 2012). Дата обращения: 8 декабря 2017.Архивировано15 июля 2017 года.

[46] Unicode Data 6.1.0(англ.).Дата обращения: 4 декабря 2017.Архивировано26 марта 2022 года.

[47] Unicode® 6.2.0(англ.).Unicode Consortium^[англ.](26 сентября 2012). Дата обращения: 7 декабря 2017.Архивировано12 февраля 2019 года.

[48] Unicode Data 6.2.0(англ.).Дата обращения: 4 декабря 2017.Архивировано26 марта 2022 года.

[49] Unicode® 6.3.0(англ.).Unicode Consortium^[англ.](30 сентября 2012). Дата обращения: 7 декабря 2017.Архивировано15 июля 2017 года.

[50] Unicode Data 6.3.0(англ.).Дата обращения: 4 декабря 2017.Архивировано7 апреля 2022 года.

[51] Unicode® 7.0.0(англ.).Unicode Consortium^[англ.](16 июня 2014). Дата обращения: 8 декабря 2017.Архивировано15 апреля 2019 года.

[52] Unicode Data 7.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано7 апреля 2022 года.

[53] Unicode® 8.0.0(англ.).Unicode Consortium^[англ.](17 июня 2015). Дата обращения: 8 декабря 2017.Архивировано28 июня 2016 года.

[54] Unicode Data 8.0.0(англ.).Дата обращения: 4 декабря 2017.Архивировано24 марта 2021 года.

[55] Unicode® 9.0.0(англ.).Unicode Consortium^[англ.](21 июня 2016). Дата обращения: 8 декабря 2017.Архивировано28 февраля 2020 года.

[56] Unicode Data 9.0.0(англ.).Дата обращения: 6 декабря 2017.Архивировано7 апреля 2022 года.

[57] Unicode® 10.0.0(англ.).Unicode Consortium^[англ.](27 июня 2017). Дата обращения: 8 декабря 2017.Архивировано20 июня 2017 года.

[58] Unicode Data 10.0.0(англ.).Дата обращения: 7 декабря 2017.Архивировано21 ноября 2021 года.

[59] Unicode Data 11.0.0(англ.).Дата обращения: 12 апреля 2019.Архивировано8 апреля 2022 года.

[60] The Unicode Blog: Announcing The Unicode® Standard, Version 11.0(неопр.).Дата обращения: 5 июня 2019.Архивировано22 июля 2019 года.

[61] Unicode 11.0.0(неопр.).Дата обращения: 5 июня 2019.Архивировано30 марта 2021 года.

[62] The Unicode Blog: Announcing The Unicode® Standard, Version 12.0(неопр.).Дата обращения: 5 июня 2019.Архивировано3 июня 2019 года.

[63] Unicode 12.0.0(неопр.).Дата обращения: 5 июня 2019.Архивировано30 марта 2021 года.

[64] The Unicode Blog: Unicode Version 12.1 released in support of the Reiwa Era(неопр.).Дата обращения: 5 июня 2019.Архивировано7 мая 2019 года.

[65] Unicode 12.1.0(неопр.).Дата обращения: 5 июня 2019.Архивировано8 июня 2019 года.

[66] The Unicode Blog: Announcing The Unicode Standard, Version 13.0(неопр.).Дата обращения: 15 мая 2020.Архивировано26 апреля 2022 года.

[67] Unicode 13.0.0(неопр.).Дата обращения: 15 мая 2020.Архивировано30 марта 2021 года.

[68] Roadmap to the TIP (Tertiary Ideographic Plane)(неопр.).Дата обращения: 12 октября 2010.Архивировано29 февраля 2020 года.

[69] Unicode Character Encoding Stability Policy(неопр.).Дата обращения: 2 мая 2014.Архивировано15 августа 2012 года.

[emoji-70] ¹ ²FAQ — Emoji & Dingbats(неопр.).Дата обращения: 2 мая 2014.Архивировано29 апреля 2014 года.

[71] Guidelines for Submitting Unicode® Emoji Proposals(неопр.).Дата обращения: 10 июня 2021.Архивировано6 июня 2021 года.

[72] Нормализация Unicode(неопр.).Дата обращения: 4 августа 2014.Архивировано8 августа 2014 года.

[73] GitHub — FortAwesome/Font-Awesome: The iconic SVG, font, and CSS toolkit(неопр.).Дата обращения: 27 июня 2020.Архивировано27 июня 2020 года.

[74] Архивированная копия(неопр.).Дата обращения: 27 февраля 2007. Архивировано изоригинала29 октября 2006 года.(англ.)

[75] Регистр в Unicode — это непросто(неопр.).Дата обращения: 9 апреля 2011.Архивировано23 апреля 2014 года.

[76] В большинстве шрифтов для ПК реализованы «прописные» (маюскульные) моноширинные цифры.

[77] В некоторых случаях документ (не простой текст) в Юникоде может занимать существенно меньше места, чем документ в однобайтовой кодировке. Например, если некая веб-страница содержит примерно поровну русского и греческого текста, то в однобайтовой кодировке придётся либо русские, либо греческие буквы записывать, используя возможности формата документов, в виде кодов с амперсандом, которые занимают 6—7 байт на символ (при использовании десятичных кодов), то есть в среднем на букву придётся 3,5—4 байта, в то время как UTF-8 занимает только 2 байта на греческую или русскую букву.

[78] Один из файлов шрифтов Arial Unicode имеет размер 24 мегабайта; существует Times New Roman размером 120 мегабайт, он содержит количество символов, близкое к 65536.

[1]

[2]

[3]

[4]

[5]

[6]

[7]

[8]

[9]

[10]

[11]

[12]

[13]

[14]

[15]

[A 1]

[A 2]

[16]

[17]

[18]

[19]

[20]

[21]

[22]

[23]

[24]

[25]

[26]

[27]

[28]

[29]

[30]

[31]

[32]

[33]

[34]

[35]

[36]

[37]

[38]

[39]

[40]

[41]

[42]

[43]

[44]

[45]

[46]

[47]

[48]

[49]

[50]

[51]

[52]

[53]

[54]

[55]

[56]

[57]

[58]

[59]

[60]

[61]

[62]

[63]

[64]

[65]

[66]

[67]

[68]

[69]

[70]

[71]

[72]

[73]

[74]

[75]

[76]

СтандартыISO
Категории:Категория:Стандарты ISO Категория:Протоколы OSI
1 по 9999	1 2 3 4 6 7 9 16 31 -0 -1 -2 -3 -4 -5 -6 -7 -8 -9 -10 -11 -12 -13 128 216 217 226 228 233 259 269 296 302 306 428 639 -1 646 668 690 732 764 796 843 898 1000 1004 1007 1073-1 1413 1538 1745 2014 2015 2022 2108 2145 2146 2281 2709 2711 2788 3029 3103 3166 -1 -2 -3 3297 3307 3602 3864 3901 3977 4031 4157 4217 5218 5775 5776 5964 6166 6344 6346 6425 6429 6438 6523 6709 7001 7002 7098 7185 7388 7498 7736 7810 7811 7812 7813 7816 8000 8217 8571 8583 8601 8632 8652 8691 8807 8820-5 8859 -1 -2 -3 -4 -5 -6 -7 -8 -9 -10 -11 -12 -13 -14 -15 -16) 8879 9000 9075 9126 9241 9362 9407 9506 9529 9564 9594 9660 9897 9945 9984 9985 9995
10000 по 19999	10006 10118-3 10160 10161 10165 10179 10206 10303 10303-11 10303-21 10303-22 10303-238 10303-28 10383 10487 10585 10589 10646 10664 10746 10861 10957 10962 10967 11073 11170 11179 11404 11544 11783 11784 11785 11801 11898 11940 11941 11941 (TR) 11992 12006 12164 12182:1998 12207:1995 12207:2008 12234-2 13211 -1 -2 13216 13250 13399 13406-2 13407 13450 13485 13490 13567 13568 13584 13616 14000 14031 14396 14443 14496-10 14496-14 ISO 14575 14644 -1 -2 -3 -4 -5 -6 -7 -8 -9 14649 14651 14698 14698-2 14750 14882 14971 15022 15189 15288 15291 15292 15408 15444 15445 15438 15504 15511 15686 15693 15706 15706-2 15707 15897 15919 15924 15926 15926 WIP 15930 16023 16262 16750 17024 17025 17369 17799 17987 18000 18004 18014 18245 18629 18916 19005 19011 19092-1 19092-2 19114 19115 19439 19501:2005 19752 19757 19770 19775-1 19794-5
20000+	20000 20022 20121 21000 21047 21500 21827:2002 22000 23008-2 23270 23360 24613 24707 25964-1 25178 26000 26300 26324 27000 series 27000 27001 27002 27003 27004 27005 27006 27007 27729 27799 29199-2 29500 31000 32000 38500 42010 50001 80000
См. также:Список статей, названия которых начинаются с «ISO»

Юникод

Содержание

Предпосылки создания и развитие Юникода

Версии Юникода

Кодовое пространство

Система кодирования

Общие принципы

Политика консорциума

Комбинирующие метки

Алгоритмы нормализации

Каноническая декомпозиция (NFD)

Каноническая композиция (NFC)

Совместимая декомпозиция (NFKD)

Совместимая композиция (NFKC)

Примеры

Двунаправленное письмо

Представленные символы

ISO/IEC 10646

Способы представления

UTF-8

UTF-16 и UTF-32

Порядок байтов

Маркер последовательности байтов

Юникод и традиционные кодировки

Реализации

Методы ввода

Microsoft Windows

Macintosh

GNU/Linux

Проблемы Юникода

Написание слова «Unicode»

См. также

Примечания

Ссылки

Навигация

Юникод

Предпосылки создания и развитие Юникода

Версии Юникода

Кодовое пространство

Система кодирования

Общие принципы

Политика консорциума

Комбинирующие метки

Алгоритмы нормализации

Каноническая декомпозиция (NFD)

Каноническая композиция (NFC)

Совместимая декомпозиция (NFKD)

Совместимая композиция (NFKC)

Примеры

Двунаправленное письмо

Представленные символы

ISO/IEC 10646

Способы представления

UTF-8

UTF-16 и UTF-32

Порядок байтов

Маркер последовательности байтов

Юникод и традиционные кодировки

Реализации

Методы ввода

Microsoft Windows

Macintosh

GNU/Linux

Проблемы Юникода

Написание слова «Unicode»

См. также

Примечания

Ссылки

Навигация

Поиск