Una computadora no recibe una fotografía como una escena ni una oración como una idea. Recibe números organizados de cierta manera.
Esa organización importa. Los mismos valores pueden conservar color, posición, frecuencia u orden; también pueden perder esas propiedades si se acomodan de otra forma. Antes de elegir un modelo, hace falta decidir qué unidades se procesarán y cómo se representarán.
La entrada sobre valores y vectores propios mostró que una matriz puede transformar una representación numérica. Aquí la pregunta aparece un paso antes: ¿de dónde sale esa representación?
Tres operaciones que conviene separar
En procesamiento de lenguaje natural, varios términos suelen aparecer juntos aunque describen tareas diferentes:
- Tokenizar consiste en dividir el texto en unidades: palabras, caracteres o fragmentos de palabra.
- Representar consiste en convertir esas unidades en vectores numéricos.
- Modelar consiste en procesar los vectores para predecir, clasificar o generar algo.
Por ejemplo, WordPiece puede dividir una palabra en fragmentos; una tabla de embeddings convierte cada fragmento en un vector; un encoder como BERT combina esos vectores con su contexto. Son tres etapas relacionadas, pero no equivalentes.
En imágenes sucede algo parecido. Leer los píxeles, organizarlos como tensor y extraer características son operaciones distintas.
Una imagen comienza como una cuadrícula
Una imagen en escala de grises puede verse como una matriz. Cada entrada indica la intensidad de un píxel. Esta imagen de , por ejemplo, contiene valores entre y :
El cero representa negro, representa blanco y los valores intermedios producen grises. La posición de cada número también contiene información: mover el a otra celda cambia la imagen.
Una imagen a color necesita tres valores por píxel:
El píxel tiene mucha intensidad roja, menos verde y todavía menos azul. Una imagen de altura y anchura se almacena entonces como un tensor con forma
Algunas bibliotecas colocan primero los canales y usan . El orden cambia, pero la información es la misma: hay una cuadrícula espacial y tres canales asociados con cada posición.
Normalizar no significa perder el color
Los canales suelen dividirse entre para pasar del intervalo a :
La normalización cambia la escala numérica, no el color representado. También es común centrar y estandarizar cada canal mediante una media y una desviación estándar :
Esto coloca los valores en un rango más conveniente para la optimización del modelo.
Aplanar una imagen: útil, pero costoso
Una matriz de puede convertirse en un vector de nueve componentes colocando una fila detrás de otra:
El resultado puede entrar directamente en una capa lineal. Sin embargo, la estructura espacial deja de ser explícita. El modelo ya no ve una cuadrícula; recibe una secuencia de nueve posiciones.
En imágenes grandes el problema crece rápido. Una fotografía RGB de contiene
números. Conectar cada uno directamente con muchas neuronas produce matrices enormes y no aprovecha que los píxeles cercanos suelen estar relacionados.
De píxeles a características
Antes del aprendizaje profundo era habitual diseñar características a mano. Un histograma de color, por ejemplo, cuenta cuántos píxeles caen en distintos intervalos de intensidad o color.
HOG significa Histogram of Oriented Gradients, o histograma de gradientes orientados. Su objetivo es describir la forma y los contornos de una imagen sin guardar cada píxel.
El primer paso consiste en medir cómo cambia la intensidad alrededor de cada píxel. Un cambio horizontal produce un gradiente y uno vertical produce . Ambos valores permiten calcular la magnitud y la orientación del cambio:
La imagen se divide después en celdas pequeñas. Dentro de cada celda, las orientaciones se agrupan en intervalos: bordes horizontales, verticales y diagonales. Un borde fuerte aporta más peso que uno débil. Las celdas vecinas se normalizan por bloques para reducir el efecto de cambios de iluminación. Finalmente, todos los histogramas se concatenan en un vector.
Estas técnicas transforman la imagen original en un vector más compacto. La transformación decide qué conservar. Un histograma de color conserva distribuciones de color, pero pierde casi toda la posición espacial. HOG conserva la distribución local de bordes y resulta útil para describir siluetas, aunque no permite reconstruir los píxeles originales.
Las redes convolucionales aprenden los filtros en lugar de fijarlos manualmente. Un filtro pequeño recorre la imagen y calcula una combinación local de píxeles. Varias capas producen mapas de características con numerosos canales:
El número ya no representa rojo, verde y azul. Cada canal aprendido puede responder a ciertos bordes, texturas o patrones más complejos. Una posición de ese tensor contiene un vector de características sobre una región de la imagen.
Parches como tokens visuales
Un Vision Transformer divide la imagen en parches. Si una imagen de se separa en cuadros de , aparecen
parches.
Cada parche RGB contiene números. Después de aplanarlo, una matriz aprendida lo proyecta a un vector de dimensión :
es el parche aplanado; es la matriz de proyección; es el embedding visual. Como todos los parches pasan por la misma matriz, el modelo obtiene una secuencia de vectores comparables. Se añade además información de posición para distinguir, por ejemplo, un parche de la esquina superior de otro situado en el centro.
Así, una imagen puede representarse como una secuencia de embeddings sin dejar de conservar su organización espacial.
Texto: primero hay que decidir las unidades
La oración
el gato persigue al ratón
puede dividirse en palabras, caracteres o fragmentos de palabra. Esa decisión determina el vocabulario y condiciona todo lo que ocurre después.
Un vocabulario por palabras es fácil de interpretar, pero crece con cada conjugación, nombre y error ortográfico. Un vocabulario por caracteres es pequeño, aunque produce secuencias largas. Los tokenizadores subword buscan un punto intermedio: conservan palabras frecuentes y dividen las menos frecuentes en piezas reutilizables.
Antes de llegar a esas piezas conviene revisar las representaciones que dominaron gran parte del PLN clásico.
One-hot: una coordenada por término
Para un vocabulario reducido
cada palabra puede representarse mediante un vector con un único :
La posición del identifica el término. La representación es dispersa: casi todas sus entradas son cero. Además, cualquier par de palabras diferentes queda a la misma distancia. One-hot distingue identidades, pero no expresa que «miedo» y «mente» puedan compartir un contexto emocional mientras «tiempo» describe otra idea.
Bolsa de palabras: contar sin conservar el orden
La bolsa de palabras, o bag of words, representa un documento completo contando cuántas veces aparece cada término del vocabulario.
Con el orden , un documento que contenga una aparición de «miedo», una de «vida» y dos de «mente» tendría el vector
Cada coordenada sigue asociada con una palabra, pero ahora su valor es una frecuencia. El método funciona bien en numerosas tareas de clasificación porque el vocabulario usado en un documento aporta mucha información.
La pérdida principal es el orden. Los fragmentos «mi mente luchando» y «luchando mi mente» producirían la misma bolsa, aunque el orden y la lectura no fueran iguales.
N-gramas: recuperar contexto local
Un n-grama es una secuencia contigua de unidades. En la frase
pestañear, abrir los ojos y tenerte
Sus bigramas incluyen
y entre sus trigramas aparecen
Una bolsa de n-gramas registra estas secuencias como nuevas características. Ahora una parte del orden queda representada: «gato persigue» y «persigue gato» ocupan coordenadas diferentes.
El costo es un vocabulario mucho mayor. También aparece la dispersión: una secuencia válida puede no haber aparecido nunca en los datos de entrenamiento.
TF-IDF: no todas las palabras informan igual
Contar términos trata igual una palabra muy común y otra característica del documento. TF-IDF combina dos cantidades.
La frecuencia de término mide cuánto aparece un término en un documento :
La frecuencia inversa de documento reduce el peso de los términos presentes en casi toda la colección:
donde es el número de documentos y cuenta en cuántos aparece . El peso final es
Si una colección contiene cinco documentos y «tiempo» aparece en dos, entonces
Si «minotauro» aparece en uno solo:
«Minotauro» recibe más peso porque distingue un único documento, mientras que «tiempo» aparece en varios. En implementaciones reales se aplican variantes con suavizado y normalización para evitar casos extremos.
Bolsa de palabras, n-gramas y TF-IDF producen vectores útiles, pero su tamaño depende del vocabulario y no capturan por sí solos el significado contextual de una palabra.
De palabras completas a subwords
Los métodos BPE, WordPiece y Unigram no producen directamente embeddings. Su función es construir un vocabulario de piezas y decidir cómo segmentar el texto antes de asignar identificadores numéricos.
Un corpus que contenga «descubrir» y «descubres» permite conservar ambas palabras completas o aprovechar fragmentos compartidos, por ejemplo:
des + cubrir
des + cubres
La segmentación exacta depende del tokenizador y de su vocabulario aprendido. La ventaja es que una palabra desconocida puede representarse mediante fragmentos conocidos.
BPE: unir pares frecuentes
Byte Pair Encoding comienza con unidades pequeñas, normalmente caracteres o bytes. Durante el entrenamiento cuenta pares adyacentes y fusiona repetidamente los más frecuentes.
Si d y e aparecen juntos muchas veces, pueden fusionarse en de. Más adelante de y s pueden formar des. Otras fusiones podrían construir cubrir. Cada fusión añade una pieza al vocabulario.
Al tokenizar, se aplican las fusiones aprendidas. Las palabras frecuentes tienden a quedar completas o en pocas piezas; las raras se dividen más.
BPE se guía principalmente por la frecuencia de los pares. No evalúa directamente cuál segmentación explica mejor todo el corpus.
WordPiece: elegir fusiones que mejoran el vocabulario
WordPiece también construye piezas frecuentes, pero selecciona combinaciones según la mejora que aportan a un modelo probabilístico del corpus, no solo por el conteo bruto del par.
Una convención común marca los fragmentos que continúan una palabra:
pertenecernos → pertenecer + ##nos
El prefijo ## indica que nos continúa una palabra y no aparece al inicio. La segmentación real depende del vocabulario entrenado; el ejemplo solo muestra la convención.
BERT utiliza habitualmente WordPiece. Antes de entrar al encoder, cada pieza se sustituye por un identificador entero de su vocabulario.
Unigram: empezar grande y eliminar piezas
El modelo Unigram sigue el camino contrario. Comienza con un vocabulario amplio de piezas posibles y asigna una probabilidad a cada una. Después elimina gradualmente las piezas cuya ausencia perjudica menos la probabilidad del corpus.
Para una palabra pueden existir varias segmentaciones. «Minotauro» podría admitir candidatos como mino + tauro, min + otauro o la palabra completa. El tokenizador busca la secuencia de piezas con mejor probabilidad conjunta. Esta formulación también permite muestrear segmentaciones alternativas durante el entrenamiento.
Las tres familias resuelven el mismo problema general con criterios distintos:
- BPE añade piezas mediante fusiones frecuentes.
- WordPiece elige piezas según la mejora de un objetivo probabilístico.
- Unigram parte de muchas piezas y elimina las menos útiles.
Después de tokenizar, cada pieza recibe un ID. Ese entero todavía no contiene significado geométrico; solo señala una fila dentro de una tabla de embeddings.
Modelos de Markov: predecir con una ventana corta
Antes de las redes neuronales modernas, los modelos de lenguaje basados en n-gramas podían formularse mediante la propiedad de Markov: el siguiente término depende de un estado limitado del pasado.
En un modelo bigrama,
La probabilidad de la siguiente palabra depende únicamente de la anterior. Un trigrama conserva las dos anteriores. Por ejemplo, un modelo trigrama podría estimar
a partir de las veces que «abrir los ojos» aparece en el corpus. Si una combinación nunca fue observada, el conteo directo le asignaría probabilidad cero.
Estas probabilidades pueden estimarse contando secuencias en un corpus. El enfoque es interpretable y rápido, pero tiene dos límites centrales:
- una ventana corta no conserva dependencias lejanas;
- aumentar multiplica el número de secuencias posibles y muchas nunca aparecen en los datos.
Las técnicas de suavizado reparten probabilidad entre eventos no observados, pero no eliminan la explosión combinatoria ni crean una representación rica del contexto.
RNN y LSTM: un estado que recorre la oración
Las redes neuronales recurrentes, o RNN, procesan la secuencia un elemento a la vez. En cada posición combinan el vector actual con un estado anterior :
El estado funciona como un resumen numérico de lo leído hasta ese punto. A diferencia de un modelo de Markov con ventana fija, una RNN puede, en principio, transportar información a lo largo de toda la secuencia. Si una frase reaparece después de varios versos, una LSTM puede conservar una señal de la primera aparición y relacionarla con la repetición posterior.
En la práctica, las RNN simples tienen dificultades para aprender dependencias largas. Durante el entrenamiento, los gradientes pueden hacerse muy pequeños o crecer sin control al atravesar muchos pasos.
La Long Short-Term Memory, o LSTM, introduce una celda de memoria y compuertas aprendidas:
- la compuerta de olvido decide qué información descartar;
- la compuerta de entrada decide qué información incorporar;
- la compuerta de salida decide qué parte exponer como estado.
Esta arquitectura mejora el flujo del gradiente y permite conservar información durante más pasos. Sin embargo, mantiene un límite importante: cada posición depende del cálculo de la anterior. La secuencia se procesa en orden, lo que dificulta paralelizar el entrenamiento. Además, una sola memoria debe transportar información a través de muchos pasos.
Atención y Transformers: relacionar posiciones directamente
La autoatención permite que cada posición consulte directamente las demás. A partir de cada vector de entrada se calculan tres representaciones mediante matrices aprendidas:
Las consultas se comparan con las claves . Los resultados determinan cuánto debe tomar cada posición de los valores :
Una palabra puede así combinar información de posiciones cercanas o lejanas sin esperar a que un estado recorra toda la oración. En «con el fin de detener el tiempo», el vector de «tiempo» puede atender directamente a «detener» y «fin». La atención multi-cabeza repite el proceso con distintas proyecciones para capturar relaciones diferentes.
Los Transformers también añaden información posicional, porque la autoatención por sí sola no distingue el orden de los tokens.
Cómo entra una oración al encoder de BERT
BERT es un Transformer compuesto por capas de encoder. Su objetivo no es guardar una definición fija por palabra, sino producir una representación contextual para cada token.
Considérese un verso:
el tiempo que me queda
El recorrido básico es el siguiente.
1. Tokenización
WordPiece divide el texto según su vocabulario. También se añaden tokens especiales como [CLS] al inicio y [SEP] al final:
[CLS] el tiempo que me queda [SEP]
Una palabra poco frecuente podría dividirse en varias piezas.
2. Identificadores
Cada token se busca en el vocabulario y se sustituye por un entero:
[CLS] → 101
el → 17
tiempo → 8421
...
Los números son ilustrativos. Un ID identifica una entrada; su magnitud no expresa significado. El token 8421 no es semánticamente mayor que el token 17.
3. Embeddings de entrada
Cada ID selecciona un vector en una matriz de embeddings. BERT suma tres componentes:
El embedding de token representa la pieza; el de posición indica dónde aparece; el de segmento puede distinguir dos secuencias dentro de la misma entrada. El resultado es un vector por posición.
4. Capas de encoder
Cada capa aplica autoatención multi-cabeza, conexiones residuales, normalización y una red neuronal por posición. Después de varias capas, cada vector incorpora información de otros tokens.
La representación de «tiempo» en «el tiempo que me queda» queda influida por «queda» y por el resto del texto. En «con el fin de detener el tiempo», la misma palabra está rodeada por el verbo «detener». Esta diferencia es la idea central de un embedding contextual: el token es el mismo, pero su vector final depende del contexto.
5. Aprendizaje
Durante el preentrenamiento original de BERT, algunos tokens se ocultan y el modelo aprende a recuperarlos usando ambos lados del contexto. Esta tarea se conoce como masked language modeling. El modelo original también incorporó una tarea de relación entre oraciones.
Después del preentrenamiento, el encoder puede ajustarse para clasificación, reconocimiento de entidades, respuesta de preguntas y otras tareas. El mismo texto de entrada produce una matriz de salida:
con un vector contextual por token. Si cada vector tiene componentes, entonces .
Una evolución con varias ramas
La historia no es una escalera en la que una técnica elimina por completo a la anterior.
Bolsa de palabras y TF-IDF siguen siendo opciones sólidas cuando importan la velocidad, la interpretación y pocos datos. Los n-gramas todavía resultan útiles para capturar patrones locales. Los tokenizadores subword resuelven el vocabulario abierto de modelos neuronales. Las LSTM conservan valor en ciertos problemas secuenciales. Los encoders Transformer dominan muchas tareas cuando se dispone de suficiente cómputo y datos.
La diferencia principal está en la información que cada representación conserva:
- one-hot conserva identidad;
- bolsa de palabras conserva frecuencia;
- n-gramas conservan orden local;
- TF-IDF pondera capacidad discriminativa;
- BPE, WordPiece y Unigram permiten construir secuencias de piezas reutilizables;
- embeddings estáticos sitúan unidades en un espacio aprendido;
- un encoder como BERT produce vectores que dependen del contexto completo.
En visión sucede una progresión comparable: píxeles, características diseñadas, mapas convolucionales y embeddings de parches conservan distintos tipos de estructura.
Representar no consiste solamente en convertir símbolos a números. Consiste en decidir qué relaciones estarán disponibles para la siguiente matriz y cuáles se perderán antes de que el modelo comience a aprender.
Comentarios 0
Todavía no hay comentarios. Puedes iniciar la conversación.