Saltar al contenido

Llevar una función con LLM a producción: recuperación, evaluación y coste

La mayoría de las funciones con LLM fallan en la recuperación, no en la elección de modelo. Deciden los pasajes recuperados, un set de evaluación propio, un presupuesto de tokens y latencia, y un plan B.

Por Luis Aguilar — Chief Technology Officer 8 min de lectura
Filas de racks de servidores negros en un centro de datos, con fibra tendida entre los armarios.
La factura de una función con LLM se paga aquí, petición a petición, mucho después de la demo. Foto: Brett Sayles / Pexels.
Contenido

Actualizado el 8 de julio de 2025 — se añaden los cambios de precio y de caché de 2024 y 2025 que reescriben el modelo de coste.

La mayoría de las funciones con LLM falla en la recuperación y no en la elección de modelo. Publicar una exige cuatro cosas: pasajes lo bastante buenos para responder, un set de evaluación propio y un presupuesto de tokens y latencia escrito antes del lanzamiento. La cuarta es un camino definido para cuando el modelo no tiene nada útil que decir.

Puntos clave

  • Patrick Lewis y sus coautores presentaron la generación aumentada por recuperación en un artículo enviado el 22 de mayo de 2020. Combina un generador preentrenado con un índice vectorial denso, así que el conocimiento se actualiza sin reentrenar.
  • Nelson Liu y sus coautores documentaron en julio de 2023 que la precisión es máxima cuando el pasaje relevante está al principio o al final del contexto. Cae cuando queda en el medio.
  • Jiawei Chen y sus coautores midieron cuatro habilidades de recuperación en septiembre de 2023. Los modelos flaquearon al rechazar, al integrar información y ante datos falsos.
  • OpenAI fijó GPT-4 Turbo en 0,01 USD por cada 1.000 tokens de entrada el 6 de noviembre de 2023 y gpt-3.5-turbo-0125 en 0,0005 USD el 25 de enero de 2024. Es una diferencia de veinte veces sobre la misma carga.
  • MTEB abarca 8 tareas de embeddings, 58 conjuntos de datos y 112 idiomas, y sus autores concluyeron que ningún método domina en todas ellas.

La recuperación decide la respuesta, no el modelo

La elección de modelo ocupa casi toda la reunión y cambia poco el resultado. Si el pasaje que contiene la respuesta nunca llega al prompt, ningún modelo lo recupera. El prompt es un contenedor; la recuperación decide qué va dentro.

Diagrama de cuatro etapas con el orden de construcción de una función con LLM: corpus, set de evaluación, pipeline de recuperación y modelo con prompt.
Solo las dos primeras etapas sobreviven a un cambio de proveedor, y son las dos que más se saltan.
Patrick Lewis y sus coautores presentaron la generación aumentada por recuperación en arXiv el 22 de mayo de 2020. Combina un modelo secuencia a secuencia preentrenado con un índice vectorial denso y produjo respuestas más específicas y factuales que una base solo paramétrica. (arXiv:2005.11401)

El trabajo real está en el corpus: cómo se trocean los documentos, qué metadatos viajan con cada fragmento y qué permisos aplican. Es un problema de arquitectura de contenido antes que de machine learning, y por eso un modelo de contenido construido sobre significado se paga dos veces.

Dónde falla de verdad la recuperación

Cuatro fallos explican la mayoría de las malas respuestas, y cada uno tiene una solución distinta.

  • Tamaño del fragmento. Demasiado pequeño pierde el contexto que lo hace interpretable; demasiado grande diluye el embedding y desperdicia tokens.
  • Vocabulario distinto. El usuario escribe “no me llegó la factura” y el documento dice “fallo en el envío de facturación”. La búsqueda vectorial pura lo pierde, así que un híbrido de palabra clave y vector recupera el caso.
  • Posición. El fragmento correcto se recupera y luego queda enterrado en mitad de un prompt largo.
  • Ausencia. No existe nada relevante y el sistema responde igualmente.
Nelson Liu y sus coautores documentaron el 6 de julio de 2023 que la precisión es máxima cuando la información relevante aparece al principio o al final del contexto. Se degrada de forma notable cuando el modelo debe encontrarla en el medio. (arXiv:2307.03172)

El último fallo es el peligroso. Jiawei Chen y sus coautores evaluaron modelos el 4 de septiembre de 2023 en robustez ante ruido, rechazo negativo, integración de información y robustez contrafactual. Con ruido se defendieron. Les costó negarse a responder, combinar datos de varios pasajes y resistir información falsa ya presente en el contexto.

El set de evaluación se construye antes que la función

Un set de evaluación son 100 o 200 preguntas reales con su respuesta esperada, el pasaje que la sustenta y una etiqueta para los casos en los que lo correcto es negarse. Se monta en dos días y sobrevive a todos los modelos.

Se ejecuta en cada cambio: nueva estrategia de troceado, nuevo modelo de embeddings, nuevo prompt, nuevo proveedor. La calidad de recuperación y la de respuesta se reportan por separado, porque una buena respuesta a partir de un mal pasaje es suerte.

Shahul Es y sus coautores publicaron Ragas el 26 de septiembre de 2023, un marco de métricas sin referencia para pipelines con recuperación. Puntúa si el contexto recuperado es relevante y está enfocado, y si la respuesta se mantiene fiel a ese contexto, sin anotaciones humanas. (arXiv:2309.15217)

Las métricas automáticas estrechan el campo, no lo cierran. Conviene mantener una revisión humana sobre una muestra fija en cada versión, y dejar esa muestra estable para que los resultados sigan siendo comparables.

Qué dicen y qué no dicen los rankings públicos

LMSYS publicó Chatbot Arena el 3 de mayo de 2023, un ranking construido con enfrentamientos anónimos y aleatorios entre modelos puntuados con Elo. Mide la preferencia humana agregada ante prompts abiertos. No mide tu tarea, sobre tu corpus, con tu presupuesto de latencia, que es la brecha con la que chocó buena parte de la primera ola de despliegues de IA generativa.

Las evaluaciones de proveedor tienen el mismo límite. Anthropic afirmó el 21 de noviembre de 2023 que Claude 2.1 reducía a la mitad las afirmaciones falsas frente a Claude 2.0, junto a una ventana de contexto de 200.000 tokens. Es una señal direccional útil de su propio banco de pruebas, no un resultado sobre tus datos.

En embeddings el panorama es aún más claro. Los autores de MTEB, en octubre de 2022, no encontraron ningún método dominante en 8 tareas, 58 conjuntos de datos y 112 idiomas. El modelo de embeddings se elige por tarea e idioma y se confirma con tu propio set de recuperación.

Presupuestar tokens antes que dinero

El coste es aritmética: tokens de entrada por su precio, más tokens de salida por el suyo, todo por el número de peticiones. El contexto recuperado domina la entrada, así que diseñar la recuperación es también diseñar el coste.

OpenAI fijó GPT-4 Turbo el 6 de noviembre de 2023 en 0,01 USD por 1.000 tokens de entrada y 0,03 USD de salida, con ventana de 128.000 tokens. El 25 de enero de 2024, gpt-3.5-turbo-0125 quedó en 0,0005 USD y 0,0015 USD. (OpenAI DevDay, OpenAI)

Piensa en un asistente de soporte que recupera seis pasajes de 500 tokens, añade un system prompt de 400 y devuelve una respuesta de 300. Son 3.400 tokens de entrada y 300 de salida por petición. Con los precios de GPT-4 Turbo sale a 0,043 USD por petición, o 430 USD con 10.000 peticiones. Con gpt-3.5-turbo-0125, ese mismo tráfico cuesta 21,50 USD.

La indexación casi no aparece en la cuenta. OpenAI fijó text-embedding-3-small en 0,00002 USD por cada 1.000 tokens el 25 de enero de 2024, así que indexar un corpus de diez millones de tokens cuesta unos 0,20 USD. Lo caro es responder, y la palanca es cuántos tokens carga cada respuesta.

La latencia es una decisión de producto, no un efecto secundario

Cada petición paga recuperación y después generación, y la generación crece con la longitud de la respuesta. El presupuesto se fija como percentil y no como media. Un p95 por debajo de tres segundos es un objetivo contra el que se puede trabajar; una media de 1,8 segundos esconde las peticiones de las que la gente se queja.

Hay tres palancas. Enviar la respuesta en streaming para que el primer token llegue pronto. Recortar el contexto recuperado a lo que la evaluación demuestre necesario. Llevar los pasos deterministas y baratos, como clasificar o enrutar, a un modelo pequeño o directamente a código.

El plan B forma parte de la función

Como los modelos son débiles al negarse, el rechazo se diseña alrededor de ellos. Se fija un umbral de puntuación de recuperación por debajo del cual la función ni siquiera llama al modelo. El texto del rechazo se redacta como decisión de producto. Y la persona usuaria pasa a un humano con la conversación adjunta.

Después se registra cada rechazo y cada traspaso, y ambos vuelven al set de evaluación. Esos registros son la única medida honesta de cobertura y van en la misma revisión que las métricas que un consejo lee de verdad.

Aquí es también donde una función con LLM deja de ser un problema de modelo y pasa a ser un problema de operaciones con responsable. Alguien tiene que ser dueño del corpus, del umbral y de la cola de escalado después del lanzamiento.

Qué cambió en esta actualización

Los precios se movieron y llegó la caché. OpenAI introdujo el prompt caching el 1 de octubre de 2024, con un descuento del 50 % sobre los tokens de entrada cacheados. El 14 de abril de 2025 fijó GPT-4.1 en 2,00 USD por millón de tokens de entrada y 8,00 USD por millón de salida. La entrada cacheada baja a 0,50 USD por millón y la ventana llega hasta un millón de tokens. Frente a los 10,00 USD por millón de entrada de GPT-4 Turbo en noviembre de 2023, el coste de entrada bajó un 80 % en diecisiete meses. El orden de ingeniería no cambia, y la decisión de construir, comprar o envolver sigue dependiendo de la calidad de recuperación y no del precio.

Gráfico de barras con los precios de entrada de OpenAI por millón de tokens: 10 USD en GPT-4 Turbo, 2 USD en GPT-4.1 y 0,5 USD cacheados.
El diseño de la recuperación sigue fijando la factura: bajó el precio por token, no los tokens de cada respuesta.

Preguntas frecuentes

¿Qué es la generación aumentada por recuperación?

Es un patrón que recupera pasajes relevantes de tu propio corpus y los coloca en el prompt antes de que el modelo responda. Patrick Lewis y sus coautores lo describieron en mayo de 2020. La ventaja es que el conocimiento se actualiza editando documentos y no reentrenando un modelo.

¿Qué modelo conviene elegir para una función con RAG?

El más barato que supere tu set de evaluación, y se vuelve a ejecutar el set cuando aparece uno nuevo. La elección de modelo mueve la calidad menos que el troceado, la búsqueda híbrida y el orden de los pasajes. Los rankings miden preferencia general, no tu corpus.

¿De qué tamaño debe ser un set de evaluación?

Entre 100 y 200 preguntas reales bastan para detectar regresiones en una primera función en producción. Cada entrada necesita la respuesta esperada, el pasaje que la sustenta y una etiqueta para las preguntas que deberían rechazarse. Crece con los registros de producción, no con la imaginación.

¿Cómo se estima el coste mensual de una función con LLM?

Se multiplican los tokens medios de entrada por su precio, se suman los de salida por el suyo y se multiplica por las peticiones mensuales previstas. El contexto recuperado suele dominar. Pasar de ocho pasajes a cuatro reduce a la mitad buena parte de la factura sin cambiar de modelo.

¿Qué debe pasar cuando el modelo no sabe la respuesta?

La función debe negarse y pasar la conversación a una persona. Se fija un umbral de recuperación por debajo del cual no hay llamada al modelo, se redacta el texto de rechazo con intención y se adjunta la conversación al traspaso. Cada rechazo se convierte así en un caso de prueba.

El orden de construcción es corpus, set de evaluación, pipeline de recuperación, modelo y prompt. Los presupuestos de tokens y de latencia se escriben antes del lanzamiento, porque los dos se vuelven políticos cuando la función ya está viva. Dentro de seis meses el número que merece reportarse no es una posición en un ranking. Es qué porcentaje de las preguntas reales de producción responde bien el sistema a la primera, con la tasa de rechazo al lado.

Compartir en

Lectura relacionada

Construyamos lo que sigue.

Creamos marcas, productos y experiencias que impulsan tu negocio.

Iniciar un proyecto
we are ONE

ONE News. Qué construimos y cómo escala.

Ideas directas y prácticas sobre marca, tecnología y rendimiento digital

Más de 1000 suscriptores

Al suscribirte, aceptas los Términos de Uso y la Política de Privacidad de Onetouch.

Iniciemos juntos un nuevo caso de estudio

01.

¿Qué necesitas?

02.

Tu presupuesto es...

03.

¿Tienes una fecha límite específica?

04.

¡Adjunta un brief del proyecto si quieres!

¡Adjunta un brief del proyecto si quieres!

05.

Sobre ti...