La investigación muestra que las mejoras en los datos impulsaron un aumento de 12 veces en la eficiencia del preentrenamiento entre 2019 y 2025, superando los avances en los modelos.

Según ChainCatcher, los investigadores Dwarkesh Patel y Jerry Han publicaron una investigación el 8 de Septiembre de 2026 en la que analizaron las contribuciones de los datos y de las mejoras de los modelos a los avances en la eficiencia del preentrenamiento entre 2019 y 2025. Con un presupuesto computacional de 1e19 FLOPs, las mejoras de los datos generaron ganancias de eficiencia computacional de 12,0x, mientras que las mejoras de los modelos contribuyeron con 3,7x, por lo que las mejoras de los datos fueron aproximadamente 3,24 veces más influyentes que las ganancias del lado del modelo. La investigación muestra que las mejoras de los datos y de los modelos son, en gran medida, independientes, y que sus efectos aditivos combinados explican el 88 % de la varianza en las puntuaciones de OLMES. La evolución de los datos avanzó desde OpenWebText, con aproximadamente 9 mil millones de tokens en 2019, hasta corpus más grandes y filtrados con mayor precisión, como UltraFineWeb, en 2025.
Aviso legal: La información en esta página puede provenir de fuentes de terceros y es solo para referencia. No representa las opiniones ni puntos de vista de Gate y no constituye asesoramiento financiero, de inversión ni legal. El comercio de activos virtuales implica un alto riesgo. No te bases únicamente en la información presentada en esta página para tomar decisiones. Para más detalles, consulta el Aviso legal.
Comentar
0/400
Sin comentarios