Benchmarks abiertos, reproducibles y publicados con DOI. CACE-Bench audita agentes de IA en pipelines de crédito; Faro anticipa la solvencia de patrocinadores de pensión.
Investigación aplicada, código abierto y metodología citable.
Código abierto (MIT) · datos y método reproducibles · DOI en Zenodo
Cada cifra de esta página sale de una corrida que usted puede repetir: código bajo licencia MIT, datos sintéticos y método publicados con DOI.
Evaluación independiente de sus agentes de IA con benchmarks abiertos. Usted corre el harness en su propia infraestructura y recibe un informe firmado: no recibo, no proceso y no almaceno datos de sus clientes. Es la configuración que mantiene el trabajo fuera del perímetro de tratamiento y almacenamiento de datos que regulan las normas de externalización.
Diagnóstico de preparación antes de una certificación o de un control interno.
El harness y el protocolo quedan en su equipo, con documentación para repetir la medición.
CACE-Bench bajo licencia MIT: cualquiera puede reproducir el resultado sin creerme.
BACEN/COAF, CNBV/UIF, SFC/UIAF, SEPS/UAFE, SBS, CMF y BCRA en un mismo marco.
Metodologías abiertas y citables (DOI). Se transfieren a bancos, fintechs y fondos de América Latina para que las corran ellos mismos, sobre sus propios datos y en su propia infraestructura.
Benchmark que audita agentes LLM en pipelines de crédito bajo reglas de compliance. Reduce los falsos positivos de compliance del 22,51% al 4,96% con un bucle de auto-evolución — corrida de referencia reproducible del repositorio, regenerable con un comando (el artículo adjunto mide otra ablación y da 23,7% a 5,1%). v0.4.1 · 3.000 solicitudes sintéticas · 4.200 empresas · ~23.000 pasos de traza etiquetados.
Anticipa dos trimestres la fragilidad financiera del patrocinador de un plan de pensiones. Índice SVI (AUC 0.887), VaR con estrés climático y límites de autoinversión dinámicos.
Publico lo que mido: el código, los datos sintéticos y el método salen con licencia MIT y DOI, para que cualquiera repita la corrida y llegue al mismo número. Es la única forma de auditar sin pedir que me crean.
Perfil completo, publicaciones y divulgación de afiliación →
Piloto en preparación con un participante del mercado de crédito de la región — banco, fintech o cooperativa. Cauce es la capa que verifica el cumplimiento y deja traza auditable dentro del flujo actual, sin reemplazar el score ni al oficial de crédito.
| País | Regulador · UIF | Verifica antes de la decisión |
|---|---|---|
| Brasil | BACEN / COAF | Inventario de modelos, model card, validación independiente, backtesting (Res. CMN 4.966; LGPD art. 20) |
| México | CNBV / UIF | KYC, CURP biométrico, expediente 10 años |
| Colombia | SFC · SES / UIAF | SARLAFT 4.0, doble consentimiento |
| Ecuador | SEPS · SB / UAFE | DD, listas y PEP, consentimiento, límites |
| Argentina | BCRA / UIF | DD basada en riesgo (Res. UIF 14/2023), listas y PEP; impugnación de valoraciones (Ley 25.326 art. 20) |
| Perú | SBS / UIF-Perú | DD y régimen reforzado, listas y PEP (Res. SBS 2660-2015); aviso de elaboración de perfiles (Ley 29733) |
| Chile | CMF / UAF | DD, listas y PEP (Ley 19.913); desde el 01.12.2026, derecho a no ser objeto de decisiones solo automatizadas, con explicación y revisión humana (Ley 21.719) |
python examples/benchmark_your_pipeline.py --demo --n 3000
Ver el adaptador (Case → Narrative) →
Cauce no reemplaza el score del prestamista ni toma la decisión de crédito. La decisión y las obligaciones regulatorias — PLD/FT, supervisión y reporte — permanecen íntegramente en el prestamista. Cauce verifica el cumplimiento y deja traza auditable.
Metodología abierta y citable. Resultados medidos sobre CACE-Bench v0.4.1 (datos sintéticos), no sobre cartera de un cliente. La cifra principal de esta sección proviene de la corrida de referencia 100% reproducible del repositorio (22,51% a 4,96%); el artículo adjunto mide otra ablación y da 23,7% a 5,1%, con alucinación de 8,6% a 5,4%. Cifras ilustrativas del método, no del desempeño en producción: la validación con datos de producción no se ha realizado. Orientación general, no asesoría legal. Cauce es un proyecto del mismo autor que CACE-Bench: el benchmark no evalúa implementaciones de Cauce en cliente y el laboratorio no audita despliegues de Cauce.
Dos grupos distintos: documentos de investigación archivados con DOI, y notas de análisis. Haga clic en un título para leer el texto completo.
Documentos de trabajo archivados con DOI en Zenodo, con código bajo licencia MIT. Reproducibles de forma independiente.
Análisis del ecosistema digital latinoamericano. No son documentos de investigación y no llevan DOI.
Artículos disponibles en español; traducción al portugués en preparación.
El análisis se ejecuta en su entorno: usted corre el harness y recibe el informe. No recibimos ni almacenamos datos de sus clientes.
Reciba el benchmark abierto de evaluación de agentes de IA y el aviso de cada versión nueva. Sin spam.
Evaluación independiente, transferencia de metodología o colaboración de investigación: escriba y respondo en español o portugués.
Trabajo remoto, con foco en Brasil, México, Colombia y Argentina. El análisis se ejecuta en el entorno del cliente: no recibo ni almaceno datos de sus clientes.
Síganos en LinkedIn y en Telegram para contenido.
Análisis de Pix (Brasil), CoDi (México) y Transferencias 3.0 (Argentina), y su impacto en la inclusión financiera.
América Latina vive una revolución en los pagos digitales. Los sistemas de transferencias inmediatas, que permiten disponer de fondos en segundos y 24/7, están redefiniendo la relación de millones de personas con el sistema financiero. Brasil, México y Argentina lideraron el proceso con tres iniciativas emblemáticas: Pix, CoDi y Transferencias 3.0.
Lanzado por el Banco Central de Brasil en noviembre de 2020, Pix ofreció una solución rápida, accesible y de bajo costo. Hasta diciembre de 2024 superaba los 168 millones de usuarios registrados y el 6 de septiembre de 2024 alcanzó un récord de 227,4 millones de transacciones en un solo día. Su verdadero impacto está en la inclusión financiera: decenas de millones de personas realizaron su primera transferencia electrónica gracias al sistema, que procesa un volumen varias veces mayor que el de las tarjetas de débito y crédito combinadas.
CoDi (Cobro Digital) del Banco de México prometía operaciones instantáneas, gratuitas y 24/7 con QR y NFC. Sin embargo, tras seis años su adopción fue muy baja: pese a decenas de millones de cuentas validadas, solo una fracción realizó pagos. La falta de incentivos, el requisito de cuenta bancaria y la competencia de alternativas más simples explican el estancamiento. México respondió después con Dimo, que usa el número de móvil del destinatario.
Lanzado por el BCRA en 2021, su innovación fueron los pagos con transferencia mediante QR y, sobre todo, la interoperabilidad: cualquier billetera puede leer cualquier QR, estimulando la competencia. Las transferencias son inmediatas, irrevocables y económicas.
Colombia, Chile y Ecuador ya desarrollan sus propias soluciones. La región puede consolidarse como referente mundial en inclusión financiera vía tecnología.
Casos de uso, ética y marco regulatorio para América Latina.
La IA generativa y el machine learning transforman el sector bancario latinoamericano: mejoran la eficiencia operativa y crean ecosistemas más ágiles, personalizados e inclusivos. Distintos análisis estiman para la región una oportunidad económica de gran escala si aprovecha la IA en la próxima década.
La adopción no está exenta de riesgos. Estudios internacionales advierten que una porción relevante de los empleos de la región está expuesta a la GenAI, y que las brechas de infraestructura y acceso digital limitan las ganancias de productividad. Se suman la desigualdad estructural y un marco regulatorio aún incipiente.
Gobiernos e instituciones deben equilibrar innovación con responsabilidad social. Las entidades que integren la IA con visión centrada en el cliente ganarán eficiencia y relevancia. Aquí una evaluación independiente de la calidad de los modelos de IA se vuelve un activo estratégico.
Propuestas para universidades, empresas y gobiernos.
América Latina enfrenta una brecha crítica de talento digital: la demanda de perfiles tecnológicos crece más rápido que la oferta y una parte importante de las vacantes de TI no logra cubrirse. Cerrarla exige una estrategia integral en tres frentes.
Reformar los currículos para incorporar competencias digitales de forma transversal y crear programas de educación ejecutiva flexibles para profesionales en activo.
Invertir de forma continua en reskilling y upskilling, y colaborar con universidades y bootcamps para construir canales de talento.
Ampliar el acceso digital, incentivar la formación con becas y créditos, y fomentar ecosistemas de innovación público-privados.
Es el puente entre la formación académica y las necesidades cambiantes del mercado: flexibilidad, contenidos pertinentes y capacidades aplicables de inmediato. Formatos online, sin exámenes de admisión y con pago flexible amplían el alcance, exactamente el modelo de DEL.
La banca de la región acelera su inversión en IA; el eslabón que falta es la auditoría de los agentes que ya deciden crédito.
Los bancos brasileños invertirán R$50,4 mil millones (~US$9,8 mil millones) en tecnología en 2026, un 8% más que el año anterior, con la IA generativa como prioridad para el 84% de las instituciones. En paralelo, el fraude con IA y deepfakes creció 830% en un año. Colocar agentes de IA en decisiones de crédito y compliance sin poder auditarlos es un riesgo de mercado y regulatorio.
Un agente de IA generativa no falla como un modelo estadístico: "alucina", inventa un dato o ignora una sanción, y lo explica de forma convincente. Cuando el Banco Central de Brasil asuma su rol de regulador sectorial de IA financiera (previsto en el PL 2338/2023), la pregunta "¿su agente es auditable?" dejara de ser teórica.
Auditar significa medir, paso a paso, alucinación, consistencia, recuperación de error y adherencia a las reglas. En el experimento descrito en el artículo adjunto sobre CACE-Bench —100% sintético— una reinterpretación regulatoria disparó los falsos positivos de compliance al 23,7%; un mecanismo de autoevolución con doble verificación los devolvió al 5,1% (-78%) y bajo la alucinación de 8,6% a 5,4%, sin regresión en los casos ya correctos. El repositorio publica además su propia corrida de referencia —una ablación de dos condiciones— con 22,51% a 4,96% (-77,9%): esa es la cifra que cualquiera regenera con un comando, byte a byte.
La lección no es el número (los datos son sintéticos), sino el método: el comportamiento de un agente puede medirse y corregirse bajo restricciones de auditabilidad.
Ver el proyecto CASE en GitHub ->
Documento de trabajo · DOI: 10.5281/zenodo.21394049
El ahorro previsional crece; vigilar hacia adelante la solvencia de quien lo respalda es la próxima frontera.
El sistema de Afores de México administra 8,3 billones de pesos (~US$488 mil millones), cerca del 23,8% del PIB, en unas 70 millones de cuentas, y la aportación obligatoria sube a 10,5% en 2026 rumbo al 15% en 2031. Pero una pensión vale lo que vale la solvencia de quien está detrás de los activos que la respaldan, y esa solvencia cambia trimestre a trimestre.
El proyecto PensionGuard propone un índice de vulnerabilidad del patrocinador (SVI) que anticipa dos trimestres la fragilidad financiera, entrenado sobre datos públicos reales (SEC EDGAR y FRED). Con validación firma-por-firma alcanza un AUC de 0,887 y marca cada episodio real de distress de la última década, manteniendo estables a compañías sólidas.
Un motor de Valor en Riesgo combina la concentración de la autoinversión con el estrés de transición climática: en un escenario desordenado, el VaR a un año de una cartera con exposición energética sube 43%. Los límites de autoinversión se ajustan solos: se aprietan cuando el patrocinador se debilita. En México, donde la IA financiera se regula vía CNBV, un modelo transparente y auditable es lo que un fondo o regulador puede explicar línea por línea.
Ver el proyecto PensionGuard en GitHub ->
Documento de trabajo · DOI: 10.5281/zenodo.21394089
En Argentina, uno de cada cuatro créditos ya nace en una fintech; los modelos de IA que los deciden aún no se auditan.
La participación de las fintech en el crédito paso de 19% en marzo de 2024 a 25% en febrero de 2026, con 9,8 millones de asistencias crediticias activas (ITBA y Cámara Argentina Fintech). Detrás de ese crecimiento hay, cada vez más, agentes de IA que deciden a quién prestar. Es una gran noticia para la inclusión, pero abre una pregunta incómoda: ¿quién audita esa IA?
Un agente de IA generativa "alucina": inventa un dato, ignora una restricción, aprueba lo que debería frenar. En crédito, eso se traduce en discriminación silenciosa, fraude que pasa el filtro y decisiones que nadie puede reconstruir. A medida que el crédito fintech gana peso sistémico, la falta de auditoría deja de ser un detalle técnico.
El benchmark CASE (CACE-Bench) muestra que el comportamiento de un agente se puede medir y corregir: un cambio de regla disparó los falsos positivos y un mecanismo de autoevolución los devolvió a un nivel operable (-77,9% en la corrida de referencia reproducible del repositorio). El camino para las fintech: auditabilidad desde el diseño, medir alucinación y consistencia, y un retro-test para cuando cambian las reglas.
Ver el proyecto CASE en GitHub ->
Documento de trabajo · DOI: 10.5281/zenodo.21394049