Operaciones de Bases de Datos
Serás dueño/a de la capa de datos en todas nuestras plataformas de cliente. Diseñarás, desplegarás y operarás infraestructura de bases de datos que abarca ChromaDB para cargas vectoriales y ScyllaDB para sistemas transaccionales de alto rendimiento.
Sobre la vacante
Buscamos a alguien de alta iniciativa que piense en modelos de datos, viva en sesiones de terminal y tenga opiniones firmes sobre los compromisos entre consistencia y disponibilidad. Este rol se sitúa en la intersección entre infraestructura e ingeniería de aplicaciones: diseñarás esquemas, optimizarás consultas, ajustarás clústeres y mantendrás nuestra capa de datos rápida y fiable en múltiples despliegues de cliente. Estamos en 2026 y esperamos que operes en consecuencia: exprime Codex y Claude Code para escribir migraciones, herramientas, harnesses de pruebas de carga y runbooks mucho más rápido que a mano, y luego verifica con rigor, porque en infraestructura de datos un cambio sin verificar es un incidente futuro. El apalancamiento es enorme y el radio de impacto también, así que quienes prosperan aquí combinan iteración veloz asistida por IA con testing disciplinado: cambios de esquema ensayados contra datos realistas, migraciones probadas en seco y reversibles, y afirmaciones de rendimiento respaldadas por benchmarks y no por intuiciones. ChromaDB y ScyllaDB son centrales en cómo construimos. ChromaDB impulsa nuestra búsqueda vectorial y nuestros pipelines de embeddings para funcionalidades potenciadas con IA; ScyllaDB atiende las cargas de alto rendimiento y baja latencia de las que dependen nuestros clientes de fintech y food-tech (millones de escrituras por segundo con p99 de un solo dígito en milisegundos). Serás dueño/a de ambas y también de la verificación que las mantiene confiables.
Qué harás
Diseñar y mantener clústeres de ScyllaDB e instancias de ChromaDB para cargas transaccionales y vectoriales de alto rendimiento en las plataformas de cliente
Usar Codex, Claude Code y herramientas similares para avanzar rápido en migraciones, automatización, harnesses de pruebas de carga y runbooks, y luego revisar y verificar cada cambio antes de que toque producción
Construir la infraestructura de testing y verificación de la capa de datos: conjuntos de datos de prueba realistas, migraciones en seco, cambios reversibles y benchmarks reproducibles
Definir modelos de datos, estrategias de particionado y políticas de compactación para ScyllaDB; construir esquemas de colecciones, indexado y optimización de consultas para ChromaDB
Respaldar cada afirmación de rendimiento y capacidad con benchmarks y pruebas de carga en lugar de suposiciones
Configurar monitoreo, alertas y planificación de capacidad, y tratar la revisión de código como una barrera principal, sobre todo en migraciones y herramientas escritas por IA
Escribir runbooks, conducir post-mortems de incidentes sin culpables y elevar de forma continua la fiabilidad operativa
Evaluar y medir nuevas herramientas de bases de datos y de IA a medida que evolucionan los requisitos de carga
Requisitos
Más de 3 años operando bases de datos distribuidas en producción (ScyllaDB, Cassandra o DynamoDB)
Alta iniciativa: eres dueño/a de la capa de datos de punta a punta, te desbloqueas solo/a e impulsas la fiabilidad sin que te lo pidan
Uso diario y fluido de herramientas de codificación con IA (Codex, Claude Code o similares) para avanzar rápido, con la disciplina de verificar y revisar lo que producen
Un hábito riguroso de testing y verificación aplicado a los datos: migraciones ensayadas, datos de prueba realistas, cambios reversibles y afirmaciones respaldadas por benchmarks
Experiencia práctica con bases de datos vectoriales (preferentemente ChromaDB; Pinecone/Weaviate/Milvus son aceptables)
Comprensión sólida del modelo de datos CQL, del diseño de particiones y de los internos de ScyllaDB (compactación, repair, streaming)
Soltura en Linux, scripting de shell, infraestructura como código (Terraform/Ansible/Pulumi) y orquestación de contenedores (Docker, Kubernetes), con fundamentos sólidos de sistemas distribuidos (CAP, consistencia eventual, consenso)
Deseable
Construyes tu propia automatización, evals o agentes para operar y verificar la infraestructura más rápido
Experiencia con ScyllaDB Alternator (API compatible con DynamoDB)
Contribuciones a proyectos de bases de datos de código abierto
Familiaridad con LangChain, LlamaIndex o frameworks similares que se integran con ChromaDB
Experiencia en ajuste de rendimiento a escala (>1M ops/seg) respaldada por benchmarks reproducibles