Entrenamiento sin exponer datos reales
Los artículos describen pipelines donde el dataset de entrenamiento se genera a partir de parámetros estadísticos, no de registros de personas. Se explica qué atributos se modelan, cómo se controla el sesgo y qué métricas de fidelidad se reportan antes de pasar a validación.
Comparativas entre generadores
Cuando dos métodos compiten por el mismo problema, publicamos la comparación con el mismo conjunto de prueba y las mismas condiciones de cómputo. Interesa ver dónde falla cada uno: iluminación, oclusión, variación étnica o resolución baja.
Sesgos que aparecen al sintetizar
Un generador no inventa diversidad por sí solo. Revisamos casos donde el modelo sintético hereda desequilibrios del generador base y cómo se corrige con muestreo estratificado o ajuste de distribución antes de reentrenar.
Métricas que sí sirven para decidir
Precisión global, F1 por subgrupo, distancia entre distribuciones real y sintética, y estabilidad ante perturbaciones. Cada resumen indica qué métrica fue determinante y cuál resultó ruido en ese experimento concreto.
Reproducibilidad y código abierto
Priorizamos trabajos con repositorio público, semillas fijadas y versiones de librerías declaradas. Si un resultado no se puede replicar con lo publicado, lo señalamos en la entrada en lugar de repetir el abstract.
Marco legal y ético aplicado
El uso de datos sintéticos no elimina todas las obligaciones. Resumimos qué exige el consentimiento informado cuando el generador se entrenó con datos reales, y qué cambia según la jurisdicción del equipo que publica.