Loading video...
Video Failed to Load
IN DESIGN THERE'S NO SINGLE CORRECT ANSWER And that's exactly why nobody's been able to dataset this properly → 200 hours of real work in Figma, not synthetic tasks → Full workflows, not isolated actions → The model has to hold the intent across dozens of steps and still... show more
44,110 views • 28 days ago •via X (Twitter)
7 Comments

matt28 days ago
acabo de mirar el repo, quiero ver cuántos flujos completos tienen antes de creerme que escala

Yutong27 days ago
“Correct” is easy to benchmark. “Feels right for this product” is where the real work starts.

zen.28 days ago
llevaba meses buscando algo así, todos los datasets de ux que veía eran juguetes de una sola pantalla

ben.28 days ago
200 horas reales de figma explica por qué esto no se puede sintetizar con gpt

liam.28 days ago
la ambigüedad como parte del dataset y no como ruido a eliminar, ahí está la diferencia real

ares. 🎧28 days ago
cómo miden si el resultado 'respeta las mejores prácticas' sin que sea un juicio subjetivo del propio equipo

fred28 days ago
esto para diseño es lo que los benchmarks de código fueron para los llms hace dos años
