lucas buchalla sestivalencia, españa +34 666 277 651rev. 2026 — ia aplicada / sistemas móvilesen/es

Ingeniero
de sistemas
de producto

flutter en producción. 20k+ usuarios.
plataforma de agentes en producción. dos tenants.

Construyo y opero una plataforma de analítica con IA multi-tenant que dos empresas consultan contra sus propios datos, y soy responsable de la arquitectura móvil detrás de una de ellas. Las mismas reglas de arquitectura valen para las dos.

supervisor langgraph, cinco agentes especialistas,
evals con ground truth, traza en cada paso.

2 tenants
una plataforma de agentes, aislados
5 suites
evals con ground truth, juzgadas a mano
20k+
usuarios móviles, 97% sin fallos
8+ años
pasante → senior

Qué hago,
sin adornos

Lucas Buchalla Sesti

Construyo y opero una plataforma de analítica con IA: un supervisor en LangGraph que enruta a cinco agentes especialistas sobre BigQuery, un grafo de código de los repositorios, un índice RAG por tenant y los vitals móviles. Dos empresas corren encima, cada una contra sus propios datos, totalmente aisladas.

También soy responsable de la arquitectura móvil en Lejour: Flutter, TDD, design systems, 20.000+ usuarios al 97% sin fallos. Los dos trabajos comparten stack: los crash reports y las tablas de BigQuery que leen los agentes son las que yo mantengo.

La evaluación es donde paso la mayor parte del tiempo. Cada cambio pasa por cinco suites de benchmark con ground truth, juzgadas a mano y con traza en cada paso, y guardo los resultados negativos con el mismo cuidado que los positivos. El trabajo de visión por computador de abajo son sobre todo resultados negativos.

medirlo · fundamentar cada afirmación · guardar los resultados negativos

IA Aplicada

dos sistemas en producción, una línea de investigación, todo medido

Analítica con IA
multi-tenant

en producción

Preguntas de negocio y de ingeniería hechas en lenguaje natural, respondidas sobre cuatro fuentes que nunca antes se habían hablado entre sí. Cada respuesta vuelve con la consulta, el commit y la traza detrás.

bigquery
datos de producto
codegraph
repositorios
chromadb
corpus rag
vitals
asc + play
agente supervisor — langgraph · reflect loop adaptativo · gemini en vertex ai
↳ "¿por qué cayeron las sesiones sin fallos en android la semana pasada?"
  vitals para la caída, después los commits que entraron esa semana.
problema

Las respuestas vivían en cuatro silos. "¿Esta regresión es nuestra?" costaba un día del tiempo de tres personas, cada vez que se preguntaba.

arquitectura

Un supervisor en LangGraph con un reflect loop por LLM que elige al siguiente especialista según la evidencia ya reunida: métrica, dimensional, código, code-review, móvil. CodeGraphContext sobre los repos, ChromaDB por tenant, BigQuery para datos de producto, App Store Connect y Play Developer Reporting para vitals. Los fast paths del modelo semántico responden lo habitual sin LLM en la ruta de SQL. Factory de LLM agnóstica de proveedor, store de investigaciones en Postgres, aislamiento por tenant desde el primer commit.

resultado

Dos empresas consultan un mismo motor contra sus propios datos, totalmente aisladas. Cuando la evidencia entra en conflicto lo dice y muestra ambas hipótesis en vez de elegir una. La regla fija es que nunca devuelve una afirmación causal que no pueda fundamentar en una fuente.

Visión por
computador en fútbol

investigación independiente
línea de investigación

Reidentificación de jugadores y reconocimiento de pose sobre imágenes de partido completo. El tracker determinista fragmenta 17 personas reales en 415 IDs a lo largo de 55 minutos; mantener la identidad a través de oclusiones, cortes de cámara y equipaciones casi idénticas es el problema abierto.

Catorce fases medidas hasta ahora. Una red de ReID afinada subió el AUC por pares de 0,913 a 0,952 y aun así no lo resolvió, porque entrena sobre etiquetas contaminadas: entre un tercio y la mitad de los raw tracks cambian de persona a mitad de track. La cámara virtual sí salió. El suavizado no causal y la mira por moda bajaron las reversiones de dirección de 25,1/min a 3,7, y el error de mira de 653px a 457px contra 18 posiciones etiquetadas a mano. Cada callejón sin salida queda documentado con sus números para no repetirlo.

reid   estimación de pose   yolo   pytorch   opencv

leer el registro completo

Cómo sé que funciona

harness de evaluación

Cinco suites de benchmark con ground truth, que cubren métrica, código, RAG, threading y end-to-end, contra un tenant sembrado con commits plantados y documentos indexados. Las corridas se etiquetan, se repiten para medir varianza, se juzgan a mano y se comparan suite a suite, con traza en cada paso. Sin mocks en la suite normal: corre contra BigQuery real y un modelo real. Es la parte menos glamurosa de la plataforma y la razón por la que me fío de lo que dice.

Workflow de entrega
para agentes

herramienta interna
en producción

Una máquina de estados que gobierna cómo un agente de código entrega cambios en un repo Flutter de 3.500 commits. Enruta la petición, lleva la tarea por spec, implementación y verificación, y se niega a dar nada por verificado bajo la palabra del agente.

El router puntúa el prompt crudo contra 23 señales regex ponderadas en portugués e inglés para elegir uno de cinco modos. El portón de release ejecuta él mismo la suite de tests y el analizador, y lee los conteos reales: tests en rojo, análisis por encima de la baseline, código tocado sin ningún test, código tocado sin ninguna doc, o un diff vacío bloquean la tarea, y la evidencia queda en un JSON por tarea. Un portón de contexto mantiene 13 invariantes, cada uno acotado a un glob de rutas, de modo que un cambio arrastra solo las reglas que cubren los archivos que tocó. Una vez el portón pasó en verde sin analizar nada: llamó al analizador con una flag que esa versión no tenía, que salía imprimiendo su usage, y el usage contenía la única palabra que el parser buscaba. Ahora exige la línea de resumen del propio analizador como prueba de que corrió.

dart cli   máquina de estados   portones de release   context engineering

Trayectoria

ocho años, tres productos, un paquete de código abierto

Lejour

desarrollador senior de móviles02/2019 — presenteremoto (hq br), desde españa

Plataforma de bodas: las parejas montan su sitio y su lista de regalos, los invitados confirman asistencia y envían fotos, y los profesionales lo gestionan todo desde una app aparte. Tres apps Flutter sobre una biblioteca interna compartida, donde soy responsable de la arquitectura móvil, el design system y la cultura de testing, y construí y opero la plataforma de analítica de arriba.

−25%
codebase
−60%
tiempo de build
−40%
tiempo de desarrollo, design system
3+
devs mentorizados, uno pasante→mid

Mude Health

desarrollador de móviles02/2025 — 07/2025tiempo parcial, hq pt

Apps de bienestar white-label multimarca en Flutter: un codebase compartido, theming y releases por marca, y una biblioteca de componentes reutilizada entre despliegues.

Onboardly

código abierto — pub.dev

Paquete Flutter para flujos de onboarding: overlays tipo spotlight y tooltips interactivos, cero dependencias externas, agnóstico a la gestión de estado. 160 pub points, ~197 descargas semanales, cinco plataformas.

ia y datos

LangGraph · supervisores + reflect loopsVertex AI · Gemini · agnóstico de proveedorRAG · ChromaDB · modelos semánticosBigQuery · PostgreSQL · Python

móvil

Flutter · DartSwift · KotliniOS · AndroidDesign systems

backend e infra

NestJS · Node · TypeScriptDocker · AnsibleGCP · AWS · FirebaseSupabase · Postgres

práctica

Evals · benchmarks · tracingTDD · tests unitariosArquitectura · modularidadMentoría · code review

idiomasportugués nativo · inglés c2español b2 · chino a1 · árabe a1
certificacioneschino — fluency academy, 2023árabe básico 2 — centro da língua árabe, 2023
hecho mobile-firstesta página se maquetó a 375pxantes de maquetarse a 1440.