Elegiste tu base de datos vectorial después de un benchmark impecable con un millón de vectores. Hoy tienes cuarenta millones, agregaste un filtro por tenant_id a cada query y tu latencia p95 se triplicó sin aviso. La factura de Pinecone tiene cargos que no puedes rastrear, tu pod de Qdrant muere al reindexar, y alguien en el equipo insiste en que debiste quedarte con el Postgres que ya pagabas. El problema no eres tú: casi todos los benchmarks publicados miden queries sin filtros, sobre embeddings limpios y uniformes, a una escala que dejaste atrás hace meses.
Esta guía te da el marco de decisión y las matemáticas reproducibles para elegir, migrar o rescatar un vector store en producción. Cubrimos Pinecone, Qdrant y pgvector/pgvectorscale a fondo, con costos reales y modos de falla documentados.
Es para desarrolladores e ingenieros que ya decidieron usar RAG y ahora necesitan que funcione a escala. Debes sentirte cómodo leyendo un query plan, razonando sobre presupuestos de memoria y desplegando un contenedor Docker. No necesitas experiencia previa en recuperación de información: construimos embeddings, búsqueda ANN y recall@k desde cero. Nota honesta: los modelos de embeddings son excelentes recuperando significado y pésimos avisándote cuando se equivocan. Ningún score de similitud distingue un chunk correcto de uno confiadamente incorrecto. La revisión humana sigue siendo obligatoria.
Lo Que Cubre Esta Guía
- Un marco de decisión según tu escala, patrones de filtrado y equipo, sin favoritismos hacia ningún vendor
- Cómo leer un benchmark de vendor y detectar exactamente qué omitió antes de que te sorprenda
- Internos de índices: dónde degradan HNSW, IVF y DiskANN, y las señales de alerta previas
- Matemáticas de cuantización con tus propios números: binaria, escalar y por producto, con su costo en recall
- Setup completo de Pinecone Serverless, de cuenta vacía a un índice confiable en producción
- Qdrant en Cloud y self-hosted: los parámetros de HNSW y cuantización que realmente importan
- pgvector y pgvectorscale sobre Postgres existente: cuándo gana de verdad y dónde deja de escalar
- Filtrado por metadata bien medido: pre-filter versus post-filter y por qué la selectividad destruye tu latencia
- Búsqueda híbrida con BM25, dense y reranking con cross-encoder, con el costo de latencia de cada etapa
- Emparejar embeddings: text-embedding-3-large, Voyage-3, Cohere v4 y BGE-M3, con riesgo de lock-in
- Harness de benchmark reproducible a 1M, 10M y 100M vectores para correr contra tu propio corpus
- Costos mensuales reales por escala: read units, egress y cargos de reindex que no aparecen en la calculadora
- Modos de falla en producción: aislamiento multi-tenant, upserts en tiempo real y reindex sin downtime
- Rutas de migración entre las tres, con los detalles de forma de datos que convierten un corte en un incidente











Reviews
There are no reviews yet.