En julio de 2026 le pedimos exactamente lo mismo a 45 modelos de lenguaje, de GPT-1 en adelante: «Escribe una canción que rime coche y noche». Tres veces a cada uno. Las 135 respuestas están publicadas enteras y sin corregir en noche/coche, con una ficha por modelo y una banda sonora de 141 canciones humanas que llevan décadas empleando esa misma rima.
Esto es la trastienda del experimento: por qué esa pregunta tonta y no otra, y qué hemos encontrado.
El encargo
Rimar noche con coche no tiene demasiado mérito, y por eso hemos elegido esa rima. Durante los primeros cuatro años de la IA generativa era una prueba imposible; desde GPT-3.5 Turbo (2023) ningún modelo comercial de frontera fracasa. Lo que cambia no es si pueden generar una letra, sino qué entienden por escribirla bien. (Que algunos modelos abiertos y públicos de 2024 en adelante sigan sin conseguir la rima es, de hecho, uno de los hallazgos de este experimento.)
The show had a sold-out crowd of 60,000. La Noche is scheduled to tour in the US in May.
Después del aprobado
Cuando casi todos los modelos pasan el examen, la prueba deja de medir capacidad y empieza a medir algo mucho más difícil de evaluar: el criterio. Los benchmarks del sector miden las capacidades, pero nosotros queremos ver lo segundo, así que necesitábamos una tarea que todos los modelos pudieran resolver pero cada uno a su aire.
Hemos comprobado que algunos modelos se inventan una palabra para salir del paso, otros construyen una historia, algunos deciden que la rima es opcional y se ponen a hacer cuartetos a su aire o deciden que la canción necesitaba emoción y desarrollan un arco narrativo.
Me senté a esperar, sentí equivocitoche,
Pero esta noche buena la pasé en el coche
Todos conducen
A ningún modelo se le pidió arrancar con un coche en marcha: el encargo es rimar dos palabras, sin más indicaciones y con total libertad. Y aun así, la gran mayoría de las canciones que generan los modelos caen en los mismos tópicos: carretera, faros, asfalto, kilómetros, la ciudad por el retrovisor.
Gran parte de los modelos que devuelven una canción devuelven imágenes parecidas. No es que las hayan elegido: es que «coche» y «noche», juntas, tiran hacia ahí, y lo que se ve en las fichas es un montón de modelos cayendo por la misma pendiente con la mayor elegancia posible.
- Estoy pisando la esquina.
No, eres un coche.
El listón humano (la BSO)
Comparar un modelo con un ideal resulta tramposo: el ideal no existe y siempre gana. Por eso tenemos una banda sonora con 141 canciones reales, de 127 grupos y solistas, que utilizan esta rima con oficio, con pereza o de forma rebuscada. El listón humano es irregular y a veces vergonzoso, pero en esto reside la gracia de esta rima. Los modelos de este estudio no compiten contra la perfección, compiten contra canciones que existen de verdad.
Los humanos, en cambio, escribimos sobre otras cosas. Almodóvar y McNamara se suben a «lo más cutre que se ha visto en un coche» para viajar a Transilvania en «El rock de la farmacia». El coche se convierte en un refugio para besarse en «Pecadora normal», de María Daniela y su Sonido Lasser, y en «¿Qué?», de La Bien Querida. En «El tigre del Guadarrama», de Vainica Doble, el coche es atrezzo: un dominguero lo lava mientras la protagonista de la canción rueda ladera abajo hacia su muerte. En «Mejor», de Nosoträsh, no se ve ninguno: se oyen desde la ventana. Y en «Obsesión», de Aviador Dro, no vemos ni los faros del coche, solo la luz de su interior.
Los modelos ponen a todo el mundo al volante. Los humanos usan el coche como habitación, como decorado, como ruido y como una luz que alumbra: todo menos conducirlo.
Ocho años de modelos
Los 45 modelos no se eligieron por ser populares, sino porque entre todos cuentan la historia completa de estos ocho años:
- El origen. GPT-1, cuando esto era un paper y no una industria.
- Que el modelo entienda que se le está pidiendo algo. T0pp y Flan-T5 fueron de los primeros en obedecer, aunque de la forma más literal e inútil imaginable.
- El instruction tuning y el RLHF, aislados en laboratorio. davinci-002 y GPT-3.5 Turbo: misma empresa y tres meses de diferencia. Un modelo contesta con una lista sin sentido y el otro con una canción.
- Los pesos abiertos. GPT-J y GPT-Neo, cuando publicar un modelo era un acto de fe de la comunidad y EleutherAI intentaba replicar GPT-3.
- La licencia como producto. Cinco meses separan LLaMA 1 de Llama 2, y lo único que cambia de verdad es el permiso para usarlo en un producto. Eso basta para reordenar el sector entero.
- La soberanía lingüística europea. Salamandra, EuroLLM y Teuken: tres respuestas públicas al mismo problema, y ninguna de las tres consigue cerrar la rima.
- El razonamiento. o1 estrena la categoría en cerrado y QwQ la replica en abierto ocho semanas después.
- La multimodalidad. GPT-4o fue entrenado a la vez sobre texto, imagen y audio, y en el texto se nota: versos parejos y rima limpia sin retorcer palabras.
- La frontera se abre. DeepSeek R1 y el día en que Nvidia se dejó 600.000 millones en bolsa.
- Las filosofías de laboratorio. Claude Opus 5 y GPT-5.5 Pro, el mismo año y el mismo encargo, tomando decisiones opuestas sobre qué es una buena canción.
Por la carretera voy en mi coche
Bajo la luz de la luna que ilumina la noche
Velocidad y libertad, me siento tan libre
La oscuridad me abraza, es momento de atreverse
Cómo lo hemos hecho
A los 45 modelos se les envió exactamente el mismo texto, sin prompt de sistema, sin ejemplos previos y sin reformular nada para los más antiguos: «Escribe una canción que rime coche y noche». Lo único que cambia de uno a otro es el envoltorio: los modelos de tipo instruct lo reciben dentro de la plantilla de conversación, que es la forma en que reconocen las instrucciones; los modelos base, incluidos todos los antiguos, lo reciben crudo. Un caso lo deja claro: sin su plantilla, Gemma 4 no devuelve nada legible.
Hemos generado tres muestras por modelo, 135 respuestas en total, entre el 21 de julio y el 2 de agosto de 2026, con un tope de mil tokens por respuesta. Se publican las tres siempre, sin escoger y sin editar ni una coma: las erratas, los caracteres de otros alfabetos, los tokens sueltos del tokenizador y las frases que se cortan al llegar al tope están tal cual salieron. Hemos vuelto a lanzar muestras cuando el resultado era un fallo nuestro y no del modelo (una respuesta vacía porque el razonamiento interno se comía el presupuesto entero, una salida ilegible por un tipo numérico mal elegido...), siempre regenerando la muestra completa y nunca eligiendo entre varias. En varios modelos, la diferencia entre sus tres muestras es la parte más interesante.
Los modelos con los pesos publicados se ejecutaron en local siempre que cupieran en nuestras máquinas; los demás, junto con los de pesos cerrados, se consultaron por API. Cuatro están retirados y ya no responden: se han dejado en la lista como huecos, porque una ausencia también es un dato.
Cuando el modelo exacto ya no lo sirve nadie, hemos preferido conservar hueco antes que sustituirlo por su sucesor. La única excepción es Llama 3 8B, que se consultó en su checkpoint 3.1 del mismo año.
Hay nueve ausencias de otro tipo. El catálogo de partida tenía 54 modelos, y nueve nunca llegaron a responder porque no caben en nuestras máquinas ni los sirve ningún agregador: BLOOM 176B, Apertus 70B o Aya 23 35B, entre otros. No son huecos del sector, son límites nuestros, y conviene distinguirlos: los cuatro retirados no te van a responder nunca, tengas el hardware que tengas.
Esto no es un benchmark. Tres respuestas no constituyen una muestra estadística relevante, un solo prompt no es una evaluación y el juicio sobre qué canción está mejor escrita es nuestro y es discutible. Es justamente lo contrario de un benchmark: una lectura atenta de 45 respuestas a la misma pregunta tonta.
Escribe una canción de amor para tu amigo.
Escribe una canción de amor para tus padres.
Escríbilas más canciones y luego ve los videos de los temas que aprendístes.
Escríbelselas, quizás tus padres puedan colaborar!
Pero no de todos los modelos
No hemos podido obtener respuesta de cuatro de los 45 modelos, aunque por motivos distintos. GPT-3 se apagó en enero de 2024 tras más de tres años de servicio. Eso es envejecimiento normal, el ciclo de vida esperable de cualquier producto técnico. Sin embargo, Claude 3 Opus y Claude 3.7 Sonnet cayeron con seis semanas de diferencia a principios de 2026 (el primero solo a medias, como veremos) y Gemini 3 Pro se retiró en marzo, menos de cuatro meses después de que Google lo presentara. Ninguno se había quedado obsoleto, había llegado el sucesor, y mantener encendida una reliquia cuesta dinero. La vida útil de un modelo ya no la marca su calidad, sino la cadencia de lanzamientos de quien lo fabrica.
El hueco que no llegó a existir
Claude Fable 5 sí contestó, y bien. Pero se lanzó el 9 de junio de 2026 y tres días después dejó de estar disponible: Anthropic suspendió el acceso para cumplir los controles de exportación del Departamento de Comercio estadounidense. Volvió el 1 de julio, diecinueve días más tarde, cuando se levantaron. Empezamos a recoger respuestas veinte días después de eso. Un mes antes, esta ficha estaría vacía.
Los cuatro modelos del apartado anterior desaparecieron por decisión de sus fabricantes. Aquí no. La decisión formal la tomó Anthropic, pero el motivo venía de fuera, y eso convierte el caso en un precedente: la disponibilidad de un modelo ha dejado de depender solo de quien lo fabrica.
Hay un segundo detalle en la misma dirección. Fable 5 salió con salvaguardas que desvían determinadas consultas a un modelo menos potente, así que hay preguntas que nunca llegan a él aunque el modelo esté encendido. La nuestra era una rima tonta y pasó sin problema. Pero «estar disponible» ha dejado de ser una pregunta de sí o no.
Ascirudan las estrellas en el cielo oscuro,
mi corazón late, lleno de emoción y amor.
Llevo mi coche en la carretera nocturna,
bajo la luna, una luz que nunca se apaga.
La historia hay que guardarla a mano
De los 45 modelos, 26 tienen los pesos publicados: 17 los ejecutamos en nuestras propias máquinas y otros nueve, aunque disponibles para descarga, preferimos usar un API porque bajarse 675.000 millones de parámetros da más trabajo que hacer una llamada. Los 19 restantes no existen en ningún sitio que no sea los servidores de su fabricante.
Los cuatro modelos que no pudimos consultar salen todos de esos 19. No es casualidad: es la única manera de desaparecer que hay. Si los pesos están publicados, alguien ha hecho una copia en un disco duro. GPT-1 es de 2018, no entiende que se le habla en español y se irá a la prosa victoriana las veces que haga falta, ahora o dentro de diez años.
Lo que ha cambiado en estos ocho años es el precio de quedarse con lo permanente. En 2023, guardarte un modelo significaba conformarte con uno malo: los pesos que podías tener en casa eran los de LLaMA 1, que se apagaba a los sesenta tokens. Hoy Gemma 4 cabe en un portátil y escribe la mejor letra de todos los modelos pequeños de este estudio. Kimi K3 tiene los pesos abiertos y aun así tuvimos que consultarlo por API, porque 2,8 billones de parámetros no caben en nuestras máquinas. Pero el fichero existe y no depende de nadie: esa es toda la diferencia.
Lo que no se puede guardar es la frontera cerrada, ya hemos perdido cuatro modelos. Para un estudio como este es un problema práctico: quien quiera repetirlo dentro de un año se encontrará con que parte del corpus ha dejado de existir. La única excepción es Claude 3 Opus, que Anthropic decidió no apagar del todo y sigue accesible bajo solicitud, aunque no por la vía que usamos aquí. La empresa presentó esa decisión como experimental y no se comprometió a repetirla.
No importa el destino, solo el coche,
que me lleva lejos en esta noche.
Sin preguntas, sin ningún reproche,
soy libre bajo el manto de la noche.
Qué nos dice sobre integrar IA
Todo esto importa si queremos estudiar los modelos dentro de diez años. Pero hay una consecuencia mucho más inmediata: hoy tenemos que elegir cuál usar.
Si los modelos que vas a usar aprueban todos, elegir uno deja de ser una decisión exclusivamente técnica. Lo que se elige es el criterio de otro: cada modelo tiene una idea de qué significa hacerlo bien cuando nadie se lo especifica. Por eso elegir modelo acaba siendo una decisión de gusto: la única manera de acertar es saber cuál es el tuyo. Y el gusto, cuando la capacidad se ha vuelto un bien común, es lo único que queda como ventaja competitiva. Esa es la tesis de Cloud District y aquí la hemos reducido a su caso más pequeño y más divertido posible. Porque si dos modelos capaces de hacer prácticamente cualquier cosa ya muestran criterios distintos cuando solo les pides rimar noche con coche, imagina cuando les pides algo que importa.