Cosa succederebbe se i laboratori di intelligenza artificiale si addestrassero per i pellicani che vanno in bicicletta?
Cosa succederebbe se i laboratori di intelligenza artificiale si addestrassero per i pellicani che vanno in bicicletta?
13 novembre 2025
Quasi ogni volta che condivido un nuovo esempio di SVG di un pellicano in sella a una bicicletta appare una variante di questa domanda: come fai a sapere che i laboratori non si stanno addestrando per il tuo benchmark?
L’argomento più forte è questo verrebbero catturati. Se finalmente esce un modello che produce un eccellente SVG di un pellicano in sella a una bicicletta, puoi scommettere che lo testerò su tutti i tipi di creature che viaggiano su tutti i tipi di mezzi di trasporto. Se questi sono notevolmente peggiori, sarà abbastanza ovvio cosa è successo.
Una nota correlata qui è che, se loro Sono allenamento per il mio punto di riferimento, quell’allenamento chiaramente non sta andando bene! I modelli migliori producono ancora pellicani su biciclette che sembrano ridicolmente orribili. È uno dei motivi per cui continuo a trovare utile il test: disegnare pellicani è difficile! Anche dare alla bicicletta la forma giusta è una sfida che pochi modelli sono ancora riusciti a raggiungere.
Il mio preferito attuale è ancora questo di GPT-5. La bicicletta ha tutti i pezzi giusti e il pellicano la sta chiaramente pedalando!

Dovrei notare che Aidan McLaughlin di OpenAI ha specificamente negato la formazione per questo particolare benchmark:
non eseguiamo salite in salita su disegni in formato SVG
Le persone mi chiedono anche se si stanno formando sulla mia raccolta pubblicata. Se lo fossero, sarebbe un grosso errore, perché un modello addestrato su questi esempi ne produrrà alcuni molto pellicani dall’aspetto strano.
A dire il vero, lo sono giocando il gioco lungo Qui. Tutto quello che ho sempre desiderato dalla vita è un’illustrazione vettoriale SVG davvero fantastica di un pellicano in sella a una bicicletta. Il mio vile piano pluriennale è ingannare diversi laboratori di intelligenza artificiale affinché investano ingenti risorse per imbrogliare il mio benchmark finché non ne ottengo uno.
