/
Feed RSS
Imagina que tienes que leer cien palabras, recordar cuál fue la tercera y usarla para decidir qué viene después de la centésima. Eso es lo que los modelos de lenguaje necesitan hacer. Durante años, la arquitectura que intentó resolverlo se llamó RNN.
En este episodio analizamos cómo funcionan las redes neuronales recurrentes, qué es el vanishing gradient y por qué provoca fallos específicos en secuencias largas, y cuándo tiene sentido usar una RNN hoy. Con el caso real de Google GNMT y cómo redujo los errores de traducción en un sesenta por ciento antes de que los transformers lo superaran.
Código interno: M1_T3_mini Serie: MaquinarIA Pesada Módulo 1 · Arquitecturas y paradigmas de IA

Deja una respuesta