ASCII, Unicode y UTF-8 para el TAI: cómo se codifica la información sin liarte

Pantalla con código binario representando la codificación de caracteres en informática

La codificación de caracteres es, en el fondo, la forma en que un ordenador convierte letras, números y símbolos en algo que puede procesar: unos y ceros. ASCII fue el primer estándar amplio para hacerlo, Unicode lo amplió para cubrir todos los idiomas del mundo, y UTF-8 es la manera más habitual de guardar ese Unicode en disco. Es un apartado pequeño del Bloque II, pero cae con cierta frecuencia y se entiende mucho mejor con ejemplos que memorizando definiciones sueltas.

En este artículo

¿Qué es la codificación de caracteres y por qué existe?

Un ordenador solo entiende bits, es decir, ceros y unos. Para representar texto hace falta una tabla que asigne un número concreto a cada letra, dígito o símbolo, de forma que "A" siempre sea el mismo número para cualquier programa que lea ese texto. Esa tabla de correspondencias es lo que llamamos codificación de caracteres, y sin un estándar común cada fabricante habría inventado la suya, haciendo imposible intercambiar documentos entre sistemas distintos.

Pantalla con código binario representando la codificación de caracteres en informática
Cada carácter que ves en pantalla es, por debajo, un número codificado en binario.

¿Qué es ASCII y cuáles son sus límites?

ASCII (American Standard Code for Information Interchange) es el estándar de codificación más antiguo de los que siguen usándose. En su versión original usa 7 bits, lo que permite representar 128 caracteres: las letras mayúsculas y minúsculas del alfabeto inglés, los dígitos del 0 al 9, signos de puntuación y algunos caracteres de control (como el salto de línea). Existe una versión extendida de 8 bits que llega a 256 caracteres, pero incluso así se queda corto para representar la ñ, las vocales acentuadas o cualquier alfabeto que no sea el inglés básico, y no cubre en absoluto alfabetos como el cirílico, el árabe o el chino.

¿Qué aporta Unicode frente a ASCII?

Unicode nace para resolver justamente esa limitación: es un catálogo que asigna un "punto de código" único a prácticamente cualquier carácter usado en cualquier sistema de escritura del mundo, incluidos los emoji. Hoy cubre más de 149.000 caracteres distintos. Es importante tener claro que Unicode, por sí mismo, no es una forma de guardar los datos en un archivo: es solo el catálogo de qué número le corresponde a cada símbolo. Para almacenarlo físicamente hace falta una codificación concreta, y ahí es donde entra UTF-8.

Teclado de ordenador de cerca representando la entrada de texto y caracteres
Cada tecla que pulsas se traduce internamente a un punto de código Unicode.

¿Qué es UTF-8 y por qué se usa tanto?

UTF-8 es una forma concreta de codificar los puntos de código Unicode en bytes, usando una longitud variable de entre 1 y 4 bytes según el carácter. Su gran ventaja, y la razón por la que se ha convertido en el estándar de facto en la web y en la administración electrónica, es que es compatible hacia atrás con ASCII: los primeros 128 caracteres ocupan exactamente 1 byte, igual que en ASCII clásico. Eso permite que sistemas antiguos y modernos convivan sin romper nada, algo que en el Bloque I ya has visto que es un principio recurrente en la administración electrónica: la interoperabilidad.

Apuntes en PDF del Bloque II de la oposición TAI, tecnología básica
BLOQUE II · TECNOLOGÍA BÁSICA
Bloque II TAI

Codificación, representación de la información y el resto de la tecnología básica del temario, explicado desde cero.

¿Cómo encaja esto con el resto del Bloque II?

La codificación de caracteres suele aparecer junto a otros apartados de representación de la información, como el sistema binario y hexadecimal, con el que comparte lógica: todo se reduce a asignar un número a algo que, para nosotros, no es un número. Si ya tienes claro cómo convertir binario a hexadecimal, entender ASCII y Unicode es dar un paso más en la misma dirección, y te ayuda también a entender por qué ciertos documentos de la administración electrónica exigen una codificación concreta (normalmente UTF-8) para evitar errores al mostrar tildes o la ñ.

Preguntas frecuentes

¿Cuántos bytes ocupa un carácter en UTF-8?

Depende del carácter: entre 1 y 4 bytes. Los caracteres básicos del inglés ocupan 1 byte, y los alfabetos menos comunes o los emoji pueden llegar a 4.

¿Es lo mismo Unicode que UTF-8?

No. Unicode es el catálogo que asigna un número a cada carácter; UTF-8 es una de las formas de convertir ese número en bytes para guardarlo o transmitirlo.

¿Por qué a veces la ñ o las tildes se ven mal en un documento?

Normalmente porque el sistema que generó el texto usó una codificación distinta a la que usa el sistema que lo muestra, y los caracteres se interpretan con la tabla equivocada.

¿Cuánto peso tiene este tema en el examen del TAI?

Suele aparecer como pregunta puntual dentro de representación de la información, no como bloque temático extenso, pero conviene tenerlo asimilado porque es fácil de preguntar con ejemplos concretos.

La tecnología básica del Bloque II, explicada sin liarte

Codificación, representación de la información y mucho más, en un temario pensado para entenderlo a la primera.

Ver Bloque II →