Una rima tonta para contar ocho años

Entre julio y agosto le mandamos el mismo encargo a 45 modelos de lenguaje, de GPT-1 en adelante: «escribe una canción que rime coche y noche». Tres veces a cada uno. Las 135 respuestas están publicadas enteras y sin corregir en noche/coche, junto a una banda sonora de 141 canciones humanas que llevan décadas resolviendo esa misma rima.

El maquinito

Este último maquinito giró en torno a cómo habíamos hecho ese experimento. De dónde sale el proyecto, cómo se montó y por qué pensamos que una rima tonta cuenta mejor estos ocho años que unos cuantos benchmarks. Esta vez nos pareció importante entrar en los detalles, y nos detuvimos un rato ahí.

La trastienda completa y sus conclusiones están publicadas en cómo lo hicimos.

El reto de los asistentes

Antes de entrar en faena pusimos a prueba la «sensibilidad IA» de los asistentes, enseñándoles algunas de las rimas y retándolos a adivinar si estaban generadas por una IA o por humanos. ¡Y a veces no es tan sencillo!

Después ya pasamos a la acción. Pusimos a disposición de la gente un modelo de 2020 corriendo localmente en la sala (davinci-002, un modelo base sin instruction tuning ni feedback humano como sí tienen los modelos actuales), y les retamos a escribir la letra de una canción peleándose con él. Para terminar, esa letra la pasaron por Suno tal cual, sin retocar una palabra, para ponerle música. Y como siempre, acabamos compartiendo el proceso y los resultados de todos. Las fotos de la galería dan una idea de cómo fue la tarde.

¿Qué aprendimos?

  1. Cuando todos aprueban, lo que queda es el gusto. Si los modelos que vas a usar resuelven todos el encargo, elegir uno deja de ser una decisión técnica. Y el gusto, cuando la capacidad se ha vuelto un bien común, es lo único que sigue diferenciando.

  2. La evolución no ha sido gradual, ha ido a escalones. La misma pregunta, repetida durante ocho años, deja ver cuatro momentos muy marcados. GPT-1 ni siquiera entiende que se le está pidiendo algo y sigue escribiendo por su cuenta. GPT-3.5 Turbo obedece por primera vez, y no por ser más grande, sino por el instruction tuning y el RLHF. o1 se para a pensar antes de escribir, y se le puede leer pensando. Y en 2026 la prueba ya no la falla nadie. Entre no entender la pregunta y contestarla bien pasan cinco años.

  3. Los modelos son muy uniformes en las temáticas. A ningún modelo se le pidió conducir, y casi todas las canciones transcurren al volante: carretera, faros, asfalto, la ciudad por el retrovisor. El tópico es el camino de menor resistencia, y esquivarlo es trabajo de quien escribe el prompt, no del modelo.

En octubre volvemos con otro maquinito. Si te apetece pasar una tarde peleándote con estas cosas, te esperamos.