CACE-Bench v0.4.1 | benchmark abierto de agentes de IA en pipelines de crédito — código MIT y DOI
Escribir
🇧🇷 🇲🇽 🇨🇴 🇨🇱 🇵🇪 🇦🇷 🇪🇨

Un laboratorio que <span class='b'>mide la IA</span> en el crédito de América Latina.

Benchmarks abiertos, reproducibles y publicados con DOI. CACE-Bench audita agentes de IA en pipelines de crédito; Faro anticipa la solvencia de patrocinadores de pensión.

Investigación aplicada, código abierto y metodología citable.

Código abierto (MIT) · datos y método reproducibles · DOI en Zenodo

Ravil Akhtyamov
Ravil Akhtyamov
Fundador · Digital Economy Lab
El diferencial

Cada cifra de esta página sale de una corrida que usted puede repetir: código bajo licencia MIT, datos sintéticos y método publicados con DOI.

Python puro sobre Pyodide: 800 casos sintéticos, seed 0, en su navegador y sin servidor.
Cifras ilustrativas del método sobre datos sintéticos, no del desempeño en producción.
23.000
pasos de traza etiquetados (CACE-Bench)
0.887
AUC — alerta de solvencia (Faro)
2
documentos con DOI (Zenodo)
7
jurisdicciones LatAm mapeadas
Español Portugués Reproducible Código abierto
ES · PTde México a Brasil
DOI + GitHubinvestigación abierta y citable
PhDen Economía
MITlicencia del benchmark
7 paísesBR MX CO CL PE AR EC
Colaboración

El análisis se ejecuta en su entorno

Evaluación independiente de sus agentes de IA con benchmarks abiertos. Usted corre el harness en su propia infraestructura y recibe un informe firmado: no recibo, no proceso y no almaceno datos de sus clientes. Es la configuración que mantiene el trabajo fuera del perímetro de tratamiento y almacenamiento de datos que regulan las normas de externalización.

🔍

Evaluación previa

Diagnóstico de preparación antes de una certificación o de un control interno.

📐

Transferencia de metodología

El harness y el protocolo quedan en su equipo, con documentación para repetir la medición.

📊

Benchmarks abiertos

CACE-Bench bajo licencia MIT: cualquiera puede reproducir el resultado sin creerme.

🌐

Mapeo regulatorio

BACEN/COAF, CNBV/UIF, SFC/UIAF, SEPS/UAFE, SBS, CMF y BCRA en un mismo marco.

Investigación aplicada

Productos de investigación aplicada

Metodologías abiertas y citables (DOI). Se transfieren a bancos, fintechs y fondos de América Latina para que las corran ellos mismos, sobre sus propios datos y en su propia infraestructura.

Cauce
IA · Crédito · Compliance

CASE — Evaluación de agentes de crédito con IA

Benchmark que audita agentes LLM en pipelines de crédito bajo reglas de compliance. Reduce los falsos positivos de compliance del 22,51% al 4,96% con un bucle de auto-evolución — corrida de referencia reproducible del repositorio, regenerable con un comando (el artículo adjunto mide otra ablación y da 23,7% a 5,1%). v0.4.1 · 3.000 solicitudes sintéticas · 4.200 empresas · ~23.000 pasos de traza etiquetados.

  • Auditoría de agentes LLM paso a paso
  • Métricas de alucinación y consistencia
  • 100% sintético y reproducible
Ver demo en vivo — cauceia.com
Documento de trabajo · DOI
Faro
Pensiones · Riesgo · IA

PensionGuard AI — Alerta temprana de solvencia

Anticipa dos trimestres la fragilidad financiera del patrocinador de un plan de pensiones. Índice SVI (AUC 0.887), VaR con estrés climático y límites de autoinversión dinámicos.

  • Índice de vulnerabilidad del patrocinador (SVI)
  • VaR con estrés de transición climática
  • Sobre datos públicos (SEC EDGAR + FRED)
Ver demo en vivo — Faro
Documento de trabajo · DOI
Ravil Akhtyamov
Quién está detrás

Quién mide, y con qué se le puede discutir

Publico lo que mido: el código, los datos sintéticos y el método salen con licencia MIT y DOI, para que cualquiera repita la corrida y llegue al mismo número. Es la única forma de auditar sin pedir que me crean.

PhD en Economía3 DOI en ZenodoPonente · SOA Symposium (Vancouver)CACE-Bench v0.4.1 · MITGitHub · @rav11l

Perfil completo, publicaciones y divulgación de afiliación →

Cauce
IA · Crédito · Compliance
Piloto en preparación · 2026
Caso

Cumplimiento auditable antes de cada decisión de crédito

Piloto en preparación con un participante del mercado de crédito de la región — banco, fintech o cooperativa. Cauce es la capa que verifica el cumplimiento y deja traza auditable dentro del flujo actual, sin reemplazar el score ni al oficial de crédito.

1
Ingesta
2
Perfilado
3 · Cauce
Cumplimiento
4
Emisión
5
Desembolso
  • Verifica KYC, listas de sanciones/PEP, consentimiento, límites y partes vinculadas antes del desembolso.
  • Deja traza auditable de cada decisión — la respuesta ante el supervisor o el comité queda lista en segundos.
  • Mapeado paso a paso a las obligaciones del prestamista: riesgo de crédito, protección de datos y prevención de lavado (PLD/FT).
  • Estructuración jurídica local en curso con un estudio de abogados del país del piloto.
No es fintech No custodia fondos No presta El prestamista decide No enruta solicitudes
−77,9%
falsos positivos de cumplimiento — de 22,51% a 4,96% (CACE-Bench · corrida reproducible)
8,6% → 5,4%
alucinación del modelo en el pipeline de crédito · artículo
100%
de las decisiones con traza auditable
Riesgo de crédito · expediente, límites y partes vinculadas PLD/FT · debida diligencia, listas y reportes · UAFE Prestamistas regulados · bancos, fintechs y cooperativas · SEPS/SB (Ecuador) Benchmark abierto · 100% sintético y reproducible
Verificación lista para su regulador — y comprobable en el navegador
Cada control, mapeado a la norma de cada país — empezando por Brasil (BACEN/LGPD), donde la demanda es normativamente obligada. El benchmark que lo mide se ejecuta en la portada, en su navegador y sin backend.

Verificación por regulador

PaísRegulador · UIFVerifica antes de la decisión
BrasilBACEN / COAFInventario de modelos, model card, validación independiente, backtesting (Res. CMN 4.966; LGPD art. 20)
MéxicoCNBV / UIFKYC, CURP biométrico, expediente 10 años
ColombiaSFC · SES / UIAFSARLAFT 4.0, doble consentimiento
EcuadorSEPS · SB / UAFEDD, listas y PEP, consentimiento, límites
ArgentinaBCRA / UIFDD basada en riesgo (Res. UIF 14/2023), listas y PEP; impugnación de valoraciones (Ley 25.326 art. 20)
PerúSBS / UIF-PerúDD y régimen reforzado, listas y PEP (Res. SBS 2660-2015); aviso de elaboración de perfiles (Ley 29733)
ChileCMF / UAFDD, listas y PEP (Ley 19.913); desde el 01.12.2026, derecho a no ser objeto de decisiones solo automatizadas, con explicación y revisión humana (Ley 21.719)

Compruébelo contra su propio pipeline

La corrida interactiva — Pyodide, 800 casos sintéticos, seed 0, sin servidor — está en la portada. El paso siguiente es medir su propio sistema con el mismo juez y las mismas métricas.
▲ Ejecutar el benchmark en la portada
Qué hay que cambiar
Cambia dos funciones y lo corre en ~una hora:
python examples/benchmark_your_pipeline.py --demo --n 3000 Ver el adaptador (Case → Narrative) →

Cauce no reemplaza el score del prestamista ni toma la decisión de crédito. La decisión y las obligaciones regulatorias — PLD/FT, supervisión y reporte — permanecen íntegramente en el prestamista. Cauce verifica el cumplimiento y deja traza auditable.

Metodología abierta y citable. Resultados medidos sobre CACE-Bench v0.4.1 (datos sintéticos), no sobre cartera de un cliente. La cifra principal de esta sección proviene de la corrida de referencia 100% reproducible del repositorio (22,51% a 4,96%); el artículo adjunto mide otra ablación y da 23,7% a 5,1%, con alucinación de 8,6% a 5,4%. Cifras ilustrativas del método, no del desempeño en producción: la validación con datos de producción no se ha realizado. Orientación general, no asesoría legal. Cauce es un proyecto del mismo autor que CACE-Bench: el benchmark no evalúa implementaciones de Cauce en cliente y el laboratorio no audita despliegues de Cauce.

Análisis

Publicaciones recientes

Dos grupos distintos: documentos de investigación archivados con DOI, y notas de análisis. Haga clic en un título para leer el texto completo.

Investigación

Documentos de trabajo archivados con DOI en Zenodo, con código bajo licencia MIT. Reproducibles de forma independiente.

IACrédito

Auditar la IA que ya decide el crédito

Julio 2026 - 5 min de lectura
Por qué la banca de la región necesita auditar a sus agentes de IA, y cómo se mide (benchmark CASE).
Leer completo ->
PensionesIA

Alerta temprana para la solvencia de las pensiones

Julio 2026 - 5 min de lectura
Cómo la IA anticipa la fragilidad de quien respalda el ahorro previsional (PensionGuard).
Leer completo ->

Notas y columnas

Análisis del ecosistema digital latinoamericano. No son documentos de investigación y no llevan DOI.

Fintech

El futuro de los pagos instantáneos en la región

15 de junio, 2026 - 8 min de lectura
Análisis de Pix (Brasil), CoDi (México) y Transferencias 3.0 (Argentina) y su impacto en la inclusión financiera.
Leer completo ->
IABanca

IA generativa en el sector bancario: oportunidades y riesgos

2 de mayo, 2026 - 12 min de lectura
Casos de uso, ética y marco regulatorio de la IA generativa para América Latina.
Leer completo ->
Talento

Brecha de talento digital: cómo cerrarla desde la educación ejecutiva

18 de abril, 2026 - 6 min de lectura
Propuestas para universidades, empresas y gobiernos ante el déficit de perfiles digitales.
Leer completo ->
FintechIA

El crédito ya es fintech; su auditoría de IA, todavía no

Julio 2026 - 5 min de lectura
El auge del crédito fintech en Argentina y la auditoría pendiente de sus modelos de IA.
Leer completo ->

Artículos disponibles en español; traducción al portugués en preparación.

Mida su IA antes de que lo haga el regulador

El análisis se ejecuta en su entorno: usted corre el harness y recibe el informe. No recibimos ni almacenamos datos de sus clientes.

Gratis

Descargue el benchmark CACE-Bench

Reciba el benchmark abierto de evaluación de agentes de IA y el aviso de cada versión nueva. Sin spam.

Hablemos

Contacto

Evaluación independiente, transferencia de metodología o colaboración de investigación: escriba y respondo en español o portugués.

Digital Economy Lab | LATAM

Trabajo remoto, con foco en Brasil, México, Colombia y Argentina. El análisis se ejecuta en el entorno del cliente: no recibo ni almaceno datos de sus clientes.

📧 latam@digitaleconomylab.org
🌐 Atención en español y portugués
🕑 Horario flexible (husos LATAM)

Síganos en LinkedIn y en Telegram para contenido.

El futuro de los pagos instantáneos en la región

15 de junio, 2026 · 8 min de lectura · Fintech

Análisis de Pix (Brasil), CoDi (México) y Transferencias 3.0 (Argentina), y su impacto en la inclusión financiera.

América Latina vive una revolución en los pagos digitales. Los sistemas de transferencias inmediatas, que permiten disponer de fondos en segundos y 24/7, están redefiniendo la relación de millones de personas con el sistema financiero. Brasil, México y Argentina lideraron el proceso con tres iniciativas emblemáticas: Pix, CoDi y Transferencias 3.0.

Pix (Brasil): el estándar de oro

Lanzado por el Banco Central de Brasil en noviembre de 2020, Pix ofreció una solución rápida, accesible y de bajo costo. Hasta diciembre de 2024 superaba los 168 millones de usuarios registrados y el 6 de septiembre de 2024 alcanzó un récord de 227,4 millones de transacciones en un solo día. Su verdadero impacto está en la inclusión financiera: decenas de millones de personas realizaron su primera transferencia electrónica gracias al sistema, que procesa un volumen varias veces mayor que el de las tarjetas de débito y crédito combinadas.

CoDi (México): una promesa incumplida

CoDi (Cobro Digital) del Banco de México prometía operaciones instantáneas, gratuitas y 24/7 con QR y NFC. Sin embargo, tras seis años su adopción fue muy baja: pese a decenas de millones de cuentas validadas, solo una fracción realizó pagos. La falta de incentivos, el requisito de cuenta bancaria y la competencia de alternativas más simples explican el estancamiento. México respondió después con Dimo, que usa el número de móvil del destinatario.

Transferencias 3.0 (Argentina): interoperabilidad

Lanzado por el BCRA en 2021, su innovación fueron los pagos con transferencia mediante QR y, sobre todo, la interoperabilidad: cualquier billetera puede leer cualquier QR, estimulando la competencia. Las transferencias son inmediatas, irrevocables y económicas.

Lecciones para la región

  • La simplicidad es clave: Pix triunfo por su facilidad; CoDi falló por fricción y falta de incentivos.
  • La interoperabilidad estimula competencia y adopción.
  • La inclusión financiera es el verdadero motor de valor.
  • El liderazgo del banco central resulta determinante.

Colombia, Chile y Ecuador ya desarrollan sus propias soluciones. La región puede consolidarse como referente mundial en inclusión financiera vía tecnología.

IA generativa en el sector bancario: oportunidades y riesgos

2 de mayo, 2026 · 12 min de lectura · IA - Banca

Casos de uso, ética y marco regulatorio para América Latina.

La IA generativa y el machine learning transforman el sector bancario latinoamericano: mejoran la eficiencia operativa y crean ecosistemas más ágiles, personalizados e inclusivos. Distintos análisis estiman para la región una oportunidad económica de gran escala si aprovecha la IA en la próxima década.

Casos de uso clave

  • Atención al cliente: asistentes que anticipan necesidades analizando patrones de gasto.
  • Detección de fraude: análisis de grandes volúmenes de datos para identificar anomalías.
  • Scoring crediticio: modelos con datos alternativos que amplían el acceso al crédito.
  • Hiperpersonalización: ofertas según perfil de riesgo y metas financieras.
  • Gestión de riesgos: predicción del impacto de factores externos como el tipo de cambio.

Riesgos y desafíos

La adopción no está exenta de riesgos. Estudios internacionales advierten que una porción relevante de los empleos de la región está expuesta a la GenAI, y que las brechas de infraestructura y acceso digital limitan las ganancias de productividad. Se suman la desigualdad estructural y un marco regulatorio aún incipiente.

El camino a seguir

Gobiernos e instituciones deben equilibrar innovación con responsabilidad social. Las entidades que integren la IA con visión centrada en el cliente ganarán eficiencia y relevancia. Aquí una evaluación independiente de la calidad de los modelos de IA se vuelve un activo estratégico.

Brecha de talento digital: cómo cerrarla desde la educación ejecutiva

18 de abril, 2026 · 6 min de lectura · Talento

Propuestas para universidades, empresas y gobiernos.

América Latina enfrenta una brecha crítica de talento digital: la demanda de perfiles tecnológicos crece más rápido que la oferta y una parte importante de las vacantes de TI no logra cubrirse. Cerrarla exige una estrategia integral en tres frentes.

1. Universidades

Reformar los currículos para incorporar competencias digitales de forma transversal y crear programas de educación ejecutiva flexibles para profesionales en activo.

2. Empresas

Invertir de forma continua en reskilling y upskilling, y colaborar con universidades y bootcamps para construir canales de talento.

3. Gobiernos

Ampliar el acceso digital, incentivar la formación con becas y créditos, y fomentar ecosistemas de innovación público-privados.

La educación ejecutiva como solución

Es el puente entre la formación académica y las necesidades cambiantes del mercado: flexibilidad, contenidos pertinentes y capacidades aplicables de inmediato. Formatos online, sin exámenes de admisión y con pago flexible amplían el alcance, exactamente el modelo de DEL.

Auditar la IA que ya decide el crédito

Julio 2026 · 5 min de lectura · IA - Crédito

La banca de la región acelera su inversión en IA; el eslabón que falta es la auditoría de los agentes que ya deciden crédito.

Los bancos brasileños invertirán R$50,4 mil millones (~US$9,8 mil millones) en tecnología en 2026, un 8% más que el año anterior, con la IA generativa como prioridad para el 84% de las instituciones. En paralelo, el fraude con IA y deepfakes creció 830% en un año. Colocar agentes de IA en decisiones de crédito y compliance sin poder auditarlos es un riesgo de mercado y regulatorio.

El error que habla bonito

Un agente de IA generativa no falla como un modelo estadístico: "alucina", inventa un dato o ignora una sanción, y lo explica de forma convincente. Cuando el Banco Central de Brasil asuma su rol de regulador sectorial de IA financiera (previsto en el PL 2338/2023), la pregunta "¿su agente es auditable?" dejara de ser teórica.

Cómo se mide

Auditar significa medir, paso a paso, alucinación, consistencia, recuperación de error y adherencia a las reglas. En el experimento descrito en el artículo adjunto sobre CACE-Bench —100% sintético— una reinterpretación regulatoria disparó los falsos positivos de compliance al 23,7%; un mecanismo de autoevolución con doble verificación los devolvió al 5,1% (-78%) y bajo la alucinación de 8,6% a 5,4%, sin regresión en los casos ya correctos. El repositorio publica además su propia corrida de referencia —una ablación de dos condiciones— con 22,51% a 4,96% (-77,9%): esa es la cifra que cualquiera regenera con un comando, byte a byte.

La lección no es el número (los datos son sintéticos), sino el método: el comportamiento de un agente puede medirse y corregirse bajo restricciones de auditabilidad.

Ver el proyecto CASE en GitHub ->

Documento de trabajo · DOI: 10.5281/zenodo.21394049

Análisis de Digital Economy Lab. Fuentes: Febraban/Deloitte y PL 2338/2023 · datos a julio de 2026.

Alerta temprana para la solvencia de las pensiones

Julio 2026 · 5 min de lectura · Pensiones - IA

El ahorro previsional crece; vigilar hacia adelante la solvencia de quien lo respalda es la próxima frontera.

El sistema de Afores de México administra 8,3 billones de pesos (~US$488 mil millones), cerca del 23,8% del PIB, en unas 70 millones de cuentas, y la aportación obligatoria sube a 10,5% en 2026 rumbo al 15% en 2031. Pero una pensión vale lo que vale la solvencia de quien está detrás de los activos que la respaldan, y esa solvencia cambia trimestre a trimestre.

Mirar hacia adelante, no hacia atrás

El proyecto PensionGuard propone un índice de vulnerabilidad del patrocinador (SVI) que anticipa dos trimestres la fragilidad financiera, entrenado sobre datos públicos reales (SEC EDGAR y FRED). Con validación firma-por-firma alcanza un AUC de 0,887 y marca cada episodio real de distress de la última década, manteniendo estables a compañías sólidas.

Concentración y clima, juntos

Un motor de Valor en Riesgo combina la concentración de la autoinversión con el estrés de transición climática: en un escenario desordenado, el VaR a un año de una cartera con exposición energética sube 43%. Los límites de autoinversión se ajustan solos: se aprietan cuando el patrocinador se debilita. En México, donde la IA financiera se regula vía CNBV, un modelo transparente y auditable es lo que un fondo o regulador puede explicar línea por línea.

Ver el proyecto PensionGuard en GitHub ->

Documento de trabajo · DOI: 10.5281/zenodo.21394089

Análisis de Digital Economy Lab. Fuentes: Consar y CNBV · datos a julio de 2026.

El crédito ya es fintech; su auditoría de IA, todavía no

Julio 2026 · 5 min de lectura · Fintech - IA

En Argentina, uno de cada cuatro créditos ya nace en una fintech; los modelos de IA que los deciden aún no se auditan.

La participación de las fintech en el crédito paso de 19% en marzo de 2024 a 25% en febrero de 2026, con 9,8 millones de asistencias crediticias activas (ITBA y Cámara Argentina Fintech). Detrás de ese crecimiento hay, cada vez más, agentes de IA que deciden a quién prestar. Es una gran noticia para la inclusión, pero abre una pregunta incómoda: ¿quién audita esa IA?

El riesgo no es que se equivoque, es no saberlo

Un agente de IA generativa "alucina": inventa un dato, ignora una restricción, aprueba lo que debería frenar. En crédito, eso se traduce en discriminación silenciosa, fraude que pasa el filtro y decisiones que nadie puede reconstruir. A medida que el crédito fintech gana peso sistémico, la falta de auditoría deja de ser un detalle técnico.

Auditar es medible

El benchmark CASE (CACE-Bench) muestra que el comportamiento de un agente se puede medir y corregir: un cambio de regla disparó los falsos positivos y un mecanismo de autoevolución los devolvió a un nivel operable (-77,9% en la corrida de referencia reproducible del repositorio). El camino para las fintech: auditabilidad desde el diseño, medir alucinación y consistencia, y un retro-test para cuando cambian las reglas.

Ver el proyecto CASE en GitHub ->

Documento de trabajo · DOI: 10.5281/zenodo.21394049

Análisis de Digital Economy Lab. Fuentes: ITBA y Cámara Argentina Fintech · datos a julio de 2026.