Synthetic Data (AI Training)
IA & ML · Profundo
Datos de entrenamiento generados artificialmente producidos por LLMs u otros modelos de IA, usados para aumentar o reemplazar conjuntos de datos anotados por humanos. Las tecnicas incluyen generación basada en prompts, pipelines aumentados por recuperacion y auto-refinamiento iterativo. Los datos sinteticos reducen costos de $5-20 por punto de preferencia humana a menos de $0.01 por muestra y se volvieron centrales en los pipelines de post-entrenamiento en 2024-2025.