Una rima tonta para contar ocho años
Entre julio y agosto le mandamos el mismo encargo a 45 modelos de lenguaje, de GPT-1 en adelante: «escribe una canción que rime coche y noche». Tres veces a cada uno. Las 135 respuestas están publicadas enteras y sin corregir en noche/coche, junto a una banda sonora de 141 canciones humanas que llevan décadas resolviendo esa misma rima.
El maquinito
Este último maquinito giró en torno a cómo habíamos hecho ese experimento. De dónde sale el proyecto, cómo se montó y por qué pensamos que una rima tonta cuenta mejor estos ocho años que unos cuantos benchmarks. Esta vez nos pareció importante entrar en los detalles, y nos detuvimos un rato ahí.
La trastienda completa y sus conclusiones están publicadas en cómo lo hicimos.
El reto de los asistentes
Antes de entrar en faena pusimos a prueba la «sensibilidad IA» de los asistentes, enseñándoles algunas de las rimas y retándolos a adivinar si estaban generadas por una IA o por humanos. ¡Y a veces no es tan sencillo!
Después ya pasamos a la acción. Pusimos a disposición de la gente un modelo de 2020 corriendo localmente en la sala (davinci-002, un modelo base sin instruction tuning ni feedback humano como sí tienen los modelos actuales), y les retamos a escribir la letra de una canción peleándose con él. Para terminar, esa letra la pasaron por Suno tal cual, sin retocar una palabra, para ponerle música. Y como siempre, acabamos compartiendo el proceso y los resultados de todos. Las fotos de la galería dan una idea de cómo fue la tarde.
¿Qué aprendimos?
-
Cuando todos aprueban, lo que queda es el gusto. Si los modelos que vas a usar resuelven todos el encargo, elegir uno deja de ser una decisión técnica. Y el gusto, cuando la capacidad se ha vuelto un bien común, es lo único que sigue diferenciando.
-
La evolución no ha sido gradual, ha ido a escalones. La misma pregunta, repetida durante ocho años, deja ver cuatro momentos muy marcados. GPT-1 ni siquiera entiende que se le está pidiendo algo y sigue escribiendo por su cuenta. GPT-3.5 Turbo obedece por primera vez, y no por ser más grande, sino por el instruction tuning y el RLHF. o1 se para a pensar antes de escribir, y se le puede leer pensando. Y en 2026 la prueba ya no la falla nadie. Entre no entender la pregunta y contestarla bien pasan cinco años.
-
Los modelos son muy uniformes en las temáticas. A ningún modelo se le pidió conducir, y casi todas las canciones transcurren al volante: carretera, faros, asfalto, la ciudad por el retrovisor. El tópico es el camino de menor resistencia, y esquivarlo es trabajo de quien escribe el prompt, no del modelo.
En octubre volvemos con otro maquinito. Si te apetece pasar una tarde peleándote con estas cosas, te esperamos.