Embeddings
¿Sabías que para una Inteligencia Artificial las palabras no son letras, sino coordenadas en un mapa invisible de miles de dimensiones? Gracias a este sistema, una computadora no sólo lee, sino que puede "medir" la distancia matemática exacta entre un perro, un gato y una fresa.
El gran dilema: ¿Cómo habla una máquina?
Las computadoras son excelentes con los números, pero terribles con el lenguaje. Para una máquina, la palabra "gato" es solo una secuencia de letras sin significado. Una primera idea para resolver esto podría ser asignarle un número de identificación único a cada palabra:
- Gato = 14.382
- Perro = 14.383
- Fresa = 920
¿El problema? Para la computadora, estos números son etiquetas vacías. No sabe que un perro y un gato son animales domésticos parecidos, ni que una fresa es una fruta roja. El número 14.382 no contiene ninguna pista sobre bigotes, maullidos o garras.
Aquí es donde entran los embeddings: la herramienta "mágica" que transforma palabras en geometría.
🎧 Podcast: La geometría del significado en la IA
¿Qué es un Embedding? Coordenadas en el mapa del significado
Para entender el concepto técnico:
"Los embeddings son representaciones en forma de vectores densos de números que convierten símbolos discretos (como palabras) en coordenadas dentro de un espacio continuo de alta dimensión..."
Vamos a descifrar esta frase paso a paso para que veas lo sencilla que es en realidad:
- Vectores densos de números: en lugar de darle a la palabra "gato" un solo número (como el 14.382), le damos una lista ordenada de muchos números (por ejemplo: [0.2, -1.3, 0.7, ...]). Cada número de esta lista describe una característica oculta del concepto.
- Espacio continuo de alta dimensión: imagina un mapa tradicional; tiene dos dimensiones: latitud y longitud. Con sólo dos números, puedes ubicar cualquier ciudad del mundo. Ahora, imagina un mapa que no tiene 2 dimensiones, ¡sino 768 o miles de dimensiones! cada dimensión es una pregunta invisible sobre la palabra (¿Es un ser vivo?, ¿es de color rojo?, ¿es una herramienta?, ¿es de la realeza?).
- Coordenadas: al final, la lista de números de una palabra es su dirección exacta en ese gigantesco mapa de miles de dimensiones.

Geometría y la matemática de las ideas
La verdadera magia ocurre cuando colocamos todas las palabras en este mapa multidimensional:
- La distancia es significado: Las palabras con significados similares terminan ubicadas muy cerca las unas de las otras. En este mapa, "gato" y "perro" estarán en el mismo vecindario, mientras que "fresa" estará en un vecindario completamente diferente.
- La dirección es relación: Las direcciones en este espacio también tienen sentido. Si viajas en línea recta desde la coordenada de "Hombre" hasta "Mujer", y luego aplicas esa misma distancia y dirección partiendo desde "Rey", ¡llegarás exactamente a la coordenada de "Reina"!
Esto permite a los modelos de Inteligencia Artificial realizar sumas y restas de conceptos con una precisión asombrosa:
¿No te parece increíble? La IA puede resolver analogías complejas simplemente midiendo distancias y direcciones en un espacio geométrico.
Palabras que cambian según su contexto
En los inicios de la IA, cada palabra tenía una única coordenada fija (los llamados embeddings estáticos, como Word2Vec). Pero el lenguaje humano es más pícaro que eso. ¿Qué pasa con la palabra "banco"?
"Me senté en un banco de la plaza."
"Fui al banco a retirar dinero."
Si usáramos una coordenada fija, la IA se confundiría. Por eso, los modelos modernos (como BERT o GPT) crean embeddings contextuales.
El punto de partida de la palabra "banco" es el mismo, pero a medida que el modelo lee las palabras que la rodean ("plaza" o "dinero"), la coordenada se desplaza dinámicamente en el mapa. El vecindario de "banco" cambia de color y posición según el contexto de la frase.
Simulador 3D embeddings
🧪 Simulador 3D embeddings
¿Cómo funciona un embedding dentro de un modelo de lenguaje?
Dentro de un modelo de lenguaje, la cadena de trabajo completa funciona así:
- Texto de entrada: Escribes tu pregunta.
- Tokenización: La IA pica la frase en tokens y les asigna IDs numéricos.
- Embedding inicial: Cada ID se convierte en su punto equivalente dentro del mapa conceptual.
- Capa de Atención / Contexto: El modelo procesa la frase entera y ajusta la posición en el mapa según el contexto (por ejemplo, entiende si la palabra "banco" se refiere a un asiento o a dinero).
- Generación: Con base en ese mapa contextualizado, la IA predice las coordenadas de la respuesta y las traduce de vuelta a palabras.
Aplicaciones prácticas de los embeddings
Más allá de los modelos de chat, los embeddings son esenciales en muchas herramientas de inteligencia artificial moderna:
Búsqueda Inteligente y RAG
Permiten buscar documentos dentro de una empresa basándose en el sentido de la pregunta y no en que coincidan las palabras exactas escritas. Tambien permiten la búsqueda de imagenes, audios o videos a partir de una descripción textual, o viceversa.
IA Multimodal
Permiten conectar en un mismo "mapa" diferentes tipos de datos, haciendo posible que la palabra escrita "perro" quede ubicada al lado de la foto de un perro o del sonido de un ladrido.
Sistemas de Recomendación
Ayudan a agrupar contenidos, canciones o productos que comparten características sutiles para sugerírselos al usuario.
Los embeddings son la piedra angular que permite a la IA comprender nuestro mundo. Aquí tienes los puntos clave para recordar:
- Traducción geométrica: Los embeddings convierten palabras individuales en listas de números que funcionan como coordenadas espaciales.
- El vecindario del significado: En el espacio de embeddings, la cercanía física (distancia) equivale a la similitud de significado (semántica).
- La dirección importa: Las relaciones entre conceptos se codifican como direcciones, permitiendo hacer "aritmética de ideas" (como Rey - Hombre + Mujer = Reina).
- Contexto dinámico: Los modelos avanzados de IA adaptan estas coordenadas en tiempo real dependiendo de las palabras vecinas en una oración.