Post #2902348
2026-04-27 14:36 UTC
3. El resultado, que está enunciado en el resumen (abstract), es clarísimo: el colapso se produce si la cantidad de datos no auto-generados por la propia IA es 'vanishing'. Es decir, mientras mantengas un porcentaje finito de datos reales, POR PEQUEÑO QUE SEA, el training sigue funcionando sin problema.
El único problema es al aumentar el tamaño del conjunto de entrenamiento al infinito de forma que la fracción real/generado -> 0. Mantén un 0.1% fijo de datos reales y ya no hay problema.
Replies (1)
-
@victorseven@mastodon.social 2026-04-27 14:39
4. La evidencia empírica claramente va en contra de la idea de que la IA no puede entrenarse con su propio output. Muchos modelos usan una gran cantidad de datos generados por IA y les va bien. Es un problema de aproximación de distribuciones. Mientras en el conjunto de entrenamiento el muestreo sea representativo la tecnología va a funcionar sin problema. El problema es conseguir un muestreo representativo de una distribución de una dimensionalidad super alta etcetc.