SynthID Research

Historia del proyecto y decisiones que marcaron el rumbo

De un cuaderno de pruebas a un archivo abierto de investigación sintética

SynthID Research empezó como un registro interno de experimentos con datos generados para entrenar modelos de reconocimiento sin tocar bases personales. Con los años ese cuaderno se convirtió en un archivo público: metodologías, correcciones y resultados que hoy cualquiera puede revisar antes de confiar en un pipeline sintético.

Primeros lotes sintéticos y el problema del sesgo heredado

Las primeras pruebas se hicieron con rostros generados para calibrar detectores de presencia. El resultado fue incómodo: los modelos aprendían rápido pero arrastraban sesgos de los generadores. Ese hallazgo obligó a separar la curaduría del dataset de la arquitectura del modelo, y quedó como regla interna desde entonces.

Protocolo de trazabilidad por lote

Cada conjunto sintético pasó a tener ficha propia: semilla, versión del generador, criterios de descarte y métricas de diversidad. La idea era simple: si un resultado no se puede reproducir, no sirve como evidencia. Este protocolo es hoy la columna vertebral de todo lo que publicamos.

Apertura del archivo y revisión externa

Publicar los cuadernos de trabajo completos, incluidos los intentos fallidos, cambió la conversación con colegas y equipos de validación. Las críticas externas ajustaron criterios de anonimización y forzaron a documentar mejor los límites de cada método. Varias correcciones del archivo actual nacieron de esas lecturas.

Colaboraciones con grupos de verificación

Trabajamos con equipos que auditan modelos de reconocimiento y necesitan datos que no expongan a personas reales. De ahí salieron pruebas cruzadas entre generadores distintos, comparaciones de robustez y una guía de uso responsable que se revisa cada temporada.

Estado actual del archivo

Hoy el archivo reúne metodologías, reportes de error y notas de campo sobre identidad sintética. No es un catálogo cerrado: se actualiza cuando aparece un método nuevo o cuando una revisión invalida algo publicado antes. La historia del proyecto sigue escribiéndose en ese mismo cuaderno, ahora abierto.

Cronología del proyecto

Cómo llegamos a un corpus sintético verificable

Cada etapa dejó un artefacto concreto: un protocolo, un conjunto de datos de prueba o una revisión abierta. No fue un plan lineal, sino una sucesión de correcciones que hoy sostienen el enfoque del grupo.

Primer semestre de 2021

Formulación del problema y revisión de literatura

El equipo partió de una pregunta acotada: qué tan lejos puede llegar un modelo de reconocimiento facial entrenado sin tocar imágenes reales de personas. Se revisaron trabajos sobre generación adversarial, anonimización y métricas de equidad, y se descartaron varios enfoques por depender de bases privadas imposibles de auditar.

Segundo semestre de 2021

Primer generador sintético y dataset piloto

Se construyó un generador de rostros con control explícito de atributos demográficos y condiciones de iluminación. El conjunto piloto quedó documentado con fichas por lote, incluyendo parámetros de muestreo y criterios de descarte. Fue la primera vez que pudimos medir sesgo sin exponer datos personales.

Primer trimestre de 2022

Protocolo de evaluación comparativa

Definimos un protocolo para contrastar modelos entrenados con datos sintéticos frente a líneas base entrenadas con datos reales, bajo las mismas condiciones de validación. El protocolo incluye métricas de precisión por subgrupo y pruebas de robustez ante variaciones de pose y resolución.

Segundo semestre de 2022

Apertura del repositorio de artefactos

Publicamos las fichas de lote, los scripts de muestreo y las tablas de resultados en un repositorio de acceso abierto. La decisión buscó que otros grupos pudieran replicar los experimentos sin depender de nuestra infraestructura ni de acuerdos de confidencialidad.

2023

Colaboraciones académicas y revisión por pares

Dos universidades adoptaron el protocolo para sus propios estudios sobre sesgo en visión por computadora. Las observaciones recibidas obligaron a reescribir la sección de limitaciones y a separar los resultados por tipo de tarea, algo que la versión inicial mezclaba.

2024 en adelante

Línea actual de trabajo

El foco está en la trazabilidad: que cualquier resultado publicado pueda rastrearse hasta el lote sintético que lo produjo. Trabajamos en versionado de datasets y en criterios de caducidad, porque un modelo entrenado con datos de hace tres años ya no refleja las condiciones actuales de captura.

Preguntas que aparecen antes de empezar a leer el digest

El archivo crece cada semana con notas sobre generación de rostros sintéticos, validación de sesgos y protocolos para no tocar bases reales. Estas son las dudas que más se repiten entre quienes llegan desde equipos de visión por computadora, laboratorios académicos o áreas de cumplimiento normativo.

¿Qué diferencia hay entre datos sintéticos y datos anonimizados?

La anonimización parte de un registro real y le quita identificadores directos, pero el rastro estadístico sigue existiendo. Los datos sintéticos se generan desde cero con un modelo entrenado para reproducir distribuciones, no personas. En el digest priorizamos trabajos donde esa distinción se mide con métricas de privacidad, no solo con declaraciones de intención.

¿Cómo se evalúa si un dataset sintético sirve para entrenar reconocimiento facial?

Se compara el desempeño del modelo entrenado con sintéticos contra uno entrenado con datos reales, usando el mismo conjunto de validación. También se revisan sesgos por tono de piel, edad y geometría del rostro. Un dataset que rinde bien en promedio pero falla en subgrupos específicos no entra en nuestras recomendaciones.

¿Los modelos generativos no terminan memorizando caras reales?

Es un riesgo concreto y aparece en la literatura desde 2021. Los artículos que cubrimos suelen incluir pruebas de extracción de identidad y de distancia mínima entre muestras generadas y el set de entrenamiento del generador. Cuando el paper no reporta ese control, lo señalamos como limitación en la ficha.

¿Qué marcos regulatorios conviene mirar si trabajo en Argentina o en la región?

La Ley 25.326 de Protección de Datos Personales sigue siendo el punto de partida local, y muchos equipos la cruzan con el GDPR cuando operan con clientes europeos. No damos asesoría legal, pero enlazamos papers que discuten cómo encajan los datasets sintéticos dentro de esos marcos. Si necesitás orientación concreta, escribinos a info@knxaustralia.com.

¿Cada cuánto se publican nuevas entradas y cómo se eligen?

Publicamos un resumen semanal y una nota más extensa cada quince días. La selección prioriza trabajos con código abierto, datasets verificables y resultados reproducibles. Descartamos papers que solo presentan métricas internas sin liberar el pipeline de evaluación.

Si querés entender quién está detrás de la curaduría, podés ver el equipo o revisar cómo tratamos los datos que circulan por el sitio.

Configuracion de cookies

Usamos cookies para mantener el sitio estable, recordar opciones basicas y entender que paginas resultan utiles. Puedes aceptar, rechazar o revisar la configuracion antes de continuar.