Saltar al contenido

Cómo entrenar un chatbot con los documentos de tu empresa (RAG explicado sin jerga)

Publicado · Actualizado

Carpetas y manuales de una empresa junto a una laptop con un chat abierto

Ningún chatbot entrenado con los documentos de tu empresa acierta el 100% de las veces. Las mejores soluciones RAG de la industria responden apenas el 63% de las preguntas sin alucinar, según el benchmark CRAG de Meta (NeurIPS 2024). Quien te prometa “cero alucinaciones” contradice evidencia pública. Aquí está cómo funciona, qué cuesta y por dónde empezar.

La segunda verdad incómoda: la mitad de los proyectos de “chatbot con mis documentos” son en realidad proyectos de documentación disfrazados. El sistema no puede citar una política que nunca se escribió.

¿Qué significa realmente “entrenar” un chatbot con mis documentos?

Tres cosas distintas se llaman “entrenar” y confundirlas es el error más caro de este tema. El 95% de los proyectos que se venden como “entrenamiento” son en realidad el segundo: RAG.

Enfoque Qué hace en realidad Para qué sirve Actualizar un dato
Fine-tuning Reentrena los pesos del modelo Estilo, formato y comportamiento Reentrenamiento completo
RAG (búsqueda + generación) Busca en tus documentos al responder y cita la fuente Conocimiento propio, cambiante y verificable Reemplazas un PDF
Prompt con contexto Pegar el documento en la conversación Decenas de páginas, un caso puntual Vuelves a pegarlo

El dato que cierra la discusión viene de Microsoft. En Fine-Tuning or Retrieval? (Ovadia et al.) los autores concluyen que “RAG lo supera consistentemente, tanto para el conocimiento visto durante el entrenamiento como para conocimiento enteramente nuevo”, y que los modelos “tienen dificultad para adquirir información factual nueva mediante fine-tuning no supervisado”.

La regla para un director general: el fine-tuning cambia cómo habla el modelo; RAG cambia qué sabe. Si el bot no conoce tu tabulador de precios ni tu política de viáticos, tu problema es RAG. Empezar por fine-tuning es gastar en lo que no resuelve.

¿Cómo funciona RAG si no soy técnico?

Imagina a un abogado recién contratado: brillante, rapidísimo, pero que no conoce nada de tu empresa. Lo sientas junto a un archivero. Cada vez que preguntas, alguien saca unas fichas y se las pone en el escritorio. Él lee solo esas fichas y redacta. Eso es RAG.

  1. Ingesta. Tus PDFs, Excels y correos entran al archivero convertidos a texto plano. Aquí mueren los PDFs escaneados y las fotos de documentos.
  2. Chunking. Los documentos se cortan en fichas de media cuartilla. Si el corte cae a media tabla, la ficha queda inservible.
  3. Embeddings. Cada ficha recibe una “coordenada de significado”, no palabras clave. Por eso “¿cuánto me toca de aguinaldo?” encuentra la que dice “gratificación anual”.
  4. Búsqueda vectorial. Salen las 5 a 20 fichas más cercanas en significado.
  5. Reranking. Un segundo lector las reordena y descarta las que solo parecían relevantes.
  6. Generación. El abogado lee únicamente esas fichas y redacta, citando cada afirmación.

La parte honesta: el abogado no sabe lo que no le llegó al escritorio, y si le llegan fichas equivocadas responde con la misma seguridad. Casi todas las fallas son del archivero, no del modelo.

¿Qué opciones existen para montarlo y cuánto cuestan?

Van de “lo armas esta tarde” a seis meses de desarrollo. Precios publicados por cada proveedor en septiembre de 2026. Donde no se publican montos, lo decimos así. Tipo de cambio: 16.9755 MXN/USD (FIX Banxico, 1 de septiembre de 2026).

Opción Costo (USD, sept 2026) Implementación Límite principal Cuándo conviene
Custom GPTs / ChatGPT Business $25 USD/usuario/mes ($20 anual, 2 a 200 usuarios) Horas Máximo 20 archivos, 512 MB c/u; sin permisos Piloto interno
Claude Projects (Team) $25 USD/usuario/mes ($20 anual), mínimo 2 asientos Horas Sin control granular de permisos Documentos densos
Gemini Notebook (antes NotebookLM) Incluido en Workspace o AI Pro Minutos No es chatbot para clientes ni se embebe Investigación interna
Chatbase Free $0 · Hobby $40 · Standard $150 · Pro $500 USD/mes 1 a 3 días 40 MB de contenido máximo (Pro) Atención a clientes
Copilot Studio $200 USD/paquete/mes (25,000 créditos); M365 Copilot $30/usuario/mes 1 a 4 semanas Hereda los permisos de SharePoint y su desorden Ya viven en Microsoft 365
Dify (nube) Sandbox gratis (50 docs) · Professional $590 · Team $1,590 USD/año 1 a 3 semanas Techo de documentos por plan Control sin programar
n8n + base vectorial Starter €20 · Pro €50/mes; self-hosted gratis 2 a 4 semanas Requiere quien lo arme y lo mantenga Conectar RAG a procesos
Vertex AI Search $1.50 USD/1,000 consultas (Standard), $4.00 (Enterprise), $5/GB/mes de índice; 10,000 consultas/mes gratis 2 a 6 semanas Dependencia de Google Cloud Volumen alto
AWS Bedrock Knowledge Bases $5 USD/GB/mes de índice + $1/1,000 llamadas Retrieve ($4/1,000 agentic) 2 a 6 semanas Dependencia de AWS Ya están en AWS
Azure AI Search No publica montos. La documentación de Microsoft usa un ejemplo ilustrativo de $100 USD/mes por unidad de búsqueda 3 a 8 semanas El precio real solo sale de la calculadora Entornos Microsoft
Desarrollo a la medida $50,000 a $300,000 MXN de implementación (estimación de mercado reportada por agencias, no auditada) más infraestructura 4 a 16 semanas Mantenimiento permanente Lógica única

Además de Azure AI Search, ni Qdrant (Standard y Premium) ni Botpress empresarial publican montos. Si alguien te los presenta como precio de lista, pide cotización formal por escrito.

¿Dónde se guardan las fichas? Las bases vectoriales

La base vectorial es el archivero. Para la mayoría de las PyMEs, con menos de uno o dos millones de fichas, la respuesta correcta es la más aburrida: pgvector sobre PostgreSQL, gratis y probablemente ya en tu stack.

  • pgvector / Supabase: gratis hasta 500 MB, Pro $25 USD/mes, Team $599 USD/mes.
  • Qdrant: free forever (1 nodo, 0.5 vCPU, 1 GB RAM, 4 GB de disco). No publica precios de Standard ni Premium.
  • Chroma: gratis en código abierto; Cloud Team $250 USD/mes más uso ($2.50/GiB escrito, $0.33/GiB-mes).
  • Weaviate: free hasta 100,000 objetos; Flex desde $45 y Premium desde $400 USD/mes.
  • Pinecone: Starter gratis (2 GB), Builder $20, Standard desde $50 y Enterprise desde $500 USD/mes con SLA de 99.95%.

¿Qué tan preciso es realmente un chatbot entrenado con mis documentos?

Menos de lo que te van a prometer. Las cifras públicas:

  • 44% con RAG directo. En el benchmark CRAG de Meta los mejores modelos solos logran hasta 34% de precisión; agregarles RAG los sube a 44%. Las soluciones comerciales llegan a 63% sin alucinar.
  • 17% a 33% de alucinación en herramientas de élite. El RegLab de Stanford evaluó 202 consultas legales: Lexis+ AI y Westlaw AI alucinan en ese rango pese a venderse como “libres de alucinaciones”. Lexis+ AI acertó 65%.
  • 25.8 puntos perdidos por digitalización. OHR-Bench, sobre más de 8,500 páginas: 67.6% de respuestas correctas con OCR estándar contra 91.2% con texto perfecto.
  • Los documentos industriales rompen el OCR. InduOCRBench (abril 2026): GPT-4o cae de 75% a 52% y PP-StructureV3 de 86.7% a 60.3%. Alta precisión de OCR no se traduce en buen RAG: 82.9% de OCR produjo 52.8% de precisión final.
  • El chunking pesa tanto como el modelo. FloTorch (2026): recursivo de 512 tokens 69%, tamaño fijo 67%, semántico 54%. Vectara (NAACL 2025), con 25 configuraciones y 48 modelos de embedding: “la configuración de chunking tuvo tanta o más influencia que la elección del modelo de embedding”.

Expectativa realista: un RAG bien construido, sobre documentos limpios y con preguntas acotadas, ronda el 70% a 85% de respuestas correctas. Ese es el número contra el que negocias. Si alguien promete 95% o “cero alucinaciones”, vende algo que la evidencia pública no respalda.

¿Cómo se mide si el chatbot está funcionando?

Con un set de evaluación, no con impresiones. El framework más usado es Ragas; también existen TruLens, DeepEval y Azure AI Foundry. Mide cinco cosas.

  • Faithfulness o groundedness: ¿la respuesta está sustentada en las fichas recuperadas? Es la métrica de alucinación.
  • Response relevancy: ¿contesta lo que se preguntó?
  • Context precision: ¿llegaron las fichas correctas?
  • Context recall: ¿faltó información que sí existía?
  • Noise sensitivity: ¿se descompone con ruido?

Exige lo mismo antes de firmar: un set de 50 a 100 preguntas reales de tu negocio, con respuestas que ya conoces, evaluado sobre el sistema propuesto. Si el proveedor se niega, ahí terminó la conversación. En nuestras implementaciones de IA ese set se arma antes de la primera línea de código.

¿Por qué fracasan los proyectos de chatbot con documentos?

Gartner pronosticó que al menos el 30% de los proyectos de IA generativa serían abandonados tras la prueba de concepto para finales de 2025. Las siete causas:

1. El contenido no existe

Nadie escribió la política que preguntas y el sistema, ante el vacío, inventa una plausible. Primero se escribe el manual, luego se automatiza.

2. PDFs escaneados y tablas

Hasta 25.8 puntos se pierden en la digitalización. Peor: las tablas cortadas por el chunker producen cifras equivocadas con formato impecable, el error más difícil de detectar.

3. Chunking mal hecho

Fragmentos de 43 tokens sin contexto o cortes a media cláusula. Entre la mejor y la peor estrategia hay hasta 15 puntos de diferencia.

4. Documentos contradictorios o vencidos

Hay tres versiones del tabulador en el repositorio y el sistema cita la de 2023 con total seguridad. RAG no tiene criterio de vigencia salvo que se lo construyas.

5. Permisos que no se heredan

El bot expone lo que el repositorio ya tenía mal permisionado. No crea la fuga: la vuelve consultable en lenguaje natural. Auditar permisos antes de indexar no es opcional.

6. Alucinación pese al RAG

Entre 17% y 33% incluso en herramientas legales de primer nivel, según Stanford. Un bot que cita fuentes puede citar la equivocada, o citar bien y concluir mal.

7. Se lanza sin medición ni dueño

Barnett et al. (CAIN/IEEE-ACM 2024), con tres casos reales —uno con 4,017 documentos y 1,000 preguntas— concluye que “la validación de un sistema RAG solo es factible durante la operación”. Sin dueño del corpus, se degrada con cada documento nuevo.

¿Cuánto cuesta y cuánto tarda según el nivel de ambición?

Nivel Tiempo Costo de software año 1 Equivalente aproximado
Piloto sin código, 5 usuarios 1 a 5 días $1,200 a $1,500 USD $20,000 a $25,500 MXN
Chatbot de clientes (Chatbase Standard) 1 a 3 semanas ~$1,800 USD más limpieza ~$30,500 MXN
Plataforma intermedia (Dify o n8n) 3 a 8 semanas $3,000 a $8,000 USD más honorarios $50,000 a $136,000 MXN
Nube empresarial (Bedrock o Vertex) 6 a 12 semanas $6,000 a $25,000 USD $100,000 a $425,000 MXN
Desarrollo a la medida 3 a 6 meses $50,000 a $300,000 MXN (estimación de mercado) más $500 a $2,000 USD/mes de infraestructura —

Conversión al FIX de 16.9755 MXN/USD. Los rangos de desarrollo a la medida son estimaciones de mercado reportadas por agencias, no precios de lista. Para un número firme, pide una cotización con alcance definido.

¿Qué riesgos legales corro en México si el chatbot se equivoca?

Dos, y ninguno es teórico. El primero: lo que diga tu chatbot te obliga. En Moffatt v. Air Canada (BC Civil Resolution Tribunal, 14 de febrero de 2024) la aerolínea pagó unos $650 CAD por una tarifa que su chatbot inventó. El tribunal rechazó que el bot fuera una entidad separada: “debería ser obvio para Air Canada que es responsable de toda la información en su sitio web”.

El segundo: datos personales. La nueva LFPDPPP (DOF del 20 de marzo de 2025) fija en su artículo 59 multas de 100 a 160,000 UMA por infracciones leves y de 200 a 320,000 UMA por graves. Con la UMA 2026 de $117.31 MXN diarios el techo son $37.5 millones MXN, y se duplica con datos sensibles. El INAI fue sustituido por la Secretaría Anticorrupción y Buen Gobierno.

¿Los proveedores entrenan sus modelos con mis documentos?

Los tres grandes dicen que no. OpenAI: “no entrenamos nuestros modelos con tus datos por defecto” en Business, Enterprise y API; retención de hasta 30 días, Zero Data Retention disponible y SOC 2 Tipo 2. Anthropic: “por defecto, no usaremos tus inputs u outputs de nuestros productos comerciales para entrenar”; con feedback explícito guarda la conversación hasta cinco años. Google Workspace: “tus cargas, consultas y respuestas no serán revisadas por humanos ni usadas para entrenar”.

¿Por dónde empiezo sin gastar de más?

Con una prueba de una semana que cuesta casi nada y te dice si el problema es la tecnología o tu archivo.

  1. Semana 1. Carga 20 documentos reales en un Custom GPT o Claude Project y escribe 50 preguntas cuya respuesta ya conoces. Mide cuántas acierta.
  2. Si acierta menos del 60%: el problema son tus documentos, no la tecnología. Arregla el archivo antes de gastar en plataforma.
  3. Si acierta más del 75%: el caso de uso sirve. Evalúa plataforma según volumen, permisos por área y canal: sitio web, WhatsApp o intranet.
  4. Nunca: empezar por fine-tuning ni firmar desarrollo a la medida sin haber corrido el paso 1.

¿Qué más preguntan antes de contratar?

¿Qué tan preciso es realmente un chatbot entrenado con documentos?

Entre 70% y 85% de respuestas correctas con documentos limpios y preguntas acotadas. El estado del arte de la industria en preguntas abiertas es 63% sin alucinar, según el benchmark CRAG de Meta. Ningún sistema llega al 100%: quien lo prometa contradice evidencia pública.

¿Mis documentos están seguros si uso ChatGPT o Claude?

En los planes de negocio, sí por contrato. OpenAI y Anthropic declaran que no entrenan con datos de clientes comerciales por defecto, y Google Workspace afirma lo mismo. Revisa retención: OpenAI conserva hasta 30 días; Anthropic, hasta cinco años las conversaciones con feedback explícito.

¿Cuánto tarda tener uno funcionando?

Un piloto interno sin código: de horas a cinco días. Un chatbot de clientes en el sitio: de una a tres semanas. Una plataforma con permisos: de tres a ocho semanas. A la medida: de tres a seis meses. Limpiar documentos tarda más que configurar.

¿Necesito un programador?

Para un piloto con Custom GPTs, Claude Projects o Chatbase, no. Para conectar permisos por área, integrar con tu ERP o publicar en WhatsApp con lógica propia, sí. La frontera práctica: si el bot debe escribir o consultar en otro sistema, ya requieres desarrollo.

¿Qué documentos sirven y cuáles no?

Sirven los textos digitales: Word, PDFs generados por computadora, páginas web y bases de conocimiento. Rompen el sistema los PDFs escaneados, las fotos de documentos, los planos, los Excels con celdas combinadas y las presentaciones con texto dentro de imágenes.

¿Cuál es la opción más barata que sí funciona?

Un Custom GPT en ChatGPT Business a $25 USD por usuario al mes ($20 USD anual), con máximo 20 archivos. Para cinco usuarios son unos $1,200 a $1,500 USD el primer año, cerca de $20,000 a $25,500 MXN. Alcanza para un piloto serio.

¿Qué pasa si el chatbot le dice algo incorrecto a un cliente?

Respondes tú. En Moffatt v. Air Canada el tribunal responsabilizó a la aerolínea por una tarifa inventada por su bot y rechazó tratarlo como entidad separada. Mitiga con avisos visibles, cita de fuente en cada respuesta, escalamiento a humano y bitácora de conversaciones.

¿Fine-tuning o RAG?

RAG, casi siempre. El paper de Microsoft Fine-Tuning or Retrieval? concluye que RAG supera consistentemente al fine-tuning para incorporar conocimiento, incluso nuevo. El fine-tuning cambia cómo habla el modelo; RAG cambia qué sabe. Actualizar un precio con fine-tuning cuesta un reentrenamiento; con RAG reemplazas un PDF.

¿Quieres saber si tus documentos aguantan un chatbot?

En Iterando medimos tu corpus real con preguntas de tu negocio antes de proponer plataforma. Si el problema resulta ser la documentación y no la tecnología, te lo decimos.

Conoce nuestras soluciones de inteligencia artificial

Escríbenos por WhatsApp