Has identificado un vacío en el mercado de las redes sociales para publicaciones muy, muy cortas. Ahora que Twitter permite publicaciones de 280 caracteres, las personas que quieren actualizaciones rápidas en redes sociales no están bien atendidas. Decides crear tu propia red social.
Para que tu producto llame la atención, lo llevas al extremo y solo permites publicaciones de 5 caracteres o menos. Cualquier publicación de más de 5 caracteres debe truncarse a 5.
Para que tus usuarios se expresen plenamente, permites emoji y otros caracteres Unicode.
La tarea es truncar los strings de entrada a 5 caracteres.
El texto almacenado digitalmente tiene que convertirse en una serie de bytes. Hay 3 formas comunes de asignar caracteres a bytes.
UTF-8 y UTF-16 son ambas codificaciones Unicode, lo que significa que son capaces de representar una enorme variedad de caracteres, entre ellos:
UTF-8 y UTF-16 son ambas codificaciones de longitud variable, lo que significa que distintos caracteres ocupan distintas cantidades de espacio.
Considera la letra «a» y el emoji «😛». En UTF-16 la letra ocupa 2 bytes, pero el emoji ocupa 4 bytes.
El truco de este ejercicio es usar una API diseñada en torno a caracteres Unicode (puntos de código) en lugar de unidades de código Unicode.
Un string «normal» codificado en UTF-16 se puede representar como una serie de caracteres, donde cada carácter puede ocupar hasta 16 bits (de ahí el nombre UTF-16). Esto significa que hay un máximo de 2¹⁶ (dos a la decimosexta potencia), o 65536 caracteres posibles representables con 16 bits, o 1 unidad de código. Estos 65536 caracteres forman lo que se conoce como el conjunto multilingüe básico, que es lo bastante grande para los caracteres más comunes de la mayoría de los idiomas.
Sin embargo, algunos símbolos no caben en una sola unidad de código. La solución es representarlos con dos unidades de código. Esas dos unidades de código UTF-16, a las que también se suele llamar par sustituto, forman un punto de código.
Entonces, en resumen, cuando hablamos de la codificación UTF-16:
code unit son 16 bits (o menos) que representan un solo carácter.code point es una o dos unidades de código que representan un solo carácter.Para añadir más confusión, también están los grupos de grafemas, que son básicamente secuencias de caracteres Unicode (puntos de código) que se deben tratar como una sola unidad visual. Por ejemplo, algunos emojis, como este 👨👦.
La mayoría de los métodos integrados de JavaScript funcionan con strings codificados en UTF-16; sin embargo, lo hacen en función de las unidades de código UTF-16.
Por ejemplo, el método String.prototype.split("") separa un string por unidades de código.
Por otro lado, los String iterators iteran por puntos de código.
Puedes leer mucho más, y encontrar ejemplos sobre strings Unicode, en MDN.
Regístrate en Exercism para aprender y dominar JavaScript con 37 conceptos159 ejercicios y mentoría humana real, todo gratis.