RAG, caché de contexto o fine-tuning
Elegir dentro del trío de adaptación —RAG, ventana de contexto larga con context caching o fine-tuning— según el volumen de datos y usuarios, la frescura del dato y cuánto se reutiliza el mismo contexto.
1. El problema de negocio
Una empresa de logística usa un asistente generativo para que su equipo de tráfico, unas veinte personas, resuelva incidencias de transporte. Cada petición envía al modelo el mismo manual de procedimientos, extenso pero estable desde hace meses, y con cientos de consultas al día el coste se ha disparado. La dirección quiere abaratarlo en pocas semanas sin construir ni mantener infraestructura nueva.
2. Solución de Google
- Servicio
- Agent Search, ventana de contexto larga con context caching o fine-tuning, según el caso
- Capa
- Plataforma
- Por qué
- El manual es acotado y estable y se reenvía en cada petición: la ventana de contexto larga lo admite entero y el context caching compensa porque ese contexto grande se reutiliza repetidamente, algo de lo que una consulta aislada no se beneficia. Agent Search encaja cuando crecen el volumen o la frescura; el fine-tuning, solo para tono, estilo o formato.
Ver la capa en el mapa de 5 capas
Capa 5Aplicaciones
La parte con la que interactúa el usuario final.
- Gemini app
- Gemini Enterprise
- Gemini for Google Workspace
- Gemini Notebook
- Gemini for Google Cloud
Capa 4Agentes
Software que persigue un objetivo usando un modelo y herramientas.
- Agentes en Agent Platform
- Customer Engagement Suite
Capa 3Plataforma[Capa de esta lección]
APIs, gestión de datos y despliegue de modelos; abstrae la infraestructura.
- Agent Studio
- Agent Search
- Model Garden
- Agent Platform AutoML
- RAG Engine
- Agent Runtime
Capa 2Modelos
Algoritmos entrenados con grandes volúmenes de datos que generan contenido.
- Gemini
- Gemma
- Imagen
- Veo
Capa 1Infraestructura
Cómputo y almacenamiento físico para entrenar y servir modelos.
- AI Hypercomputer
- Cloud TPU
- GPU
- Centros de datos de Google
3. Límites
- No la uses si
- El manual crece hasta superar la ventana de contexto o pasan a consultarlo miles de usuarios concurrentes.
- Variable que fuerza el cambio
- Volumen de usuarios o datos
- Alternativa
- RAG con Agent Search
4. La trampa del examen
- [✗] Distractor
- Fragmentar el manual, generar embeddings e indexarlo en una base de datos vectorial para recuperar en cada consulta solo los pasajes relevantes.
- Por qué tienta
- RAG es la respuesta habitual cuando hay documentos de por medio y parece la forma natural de no enviar el manual completo en cada petición.
- Por qué es incorrecto
- El corpus es acotado, estable y lo usa un equipo pequeño: la ventana de contexto larga lo admite entero y el context caching abarata su reutilización, sin la infraestructura de indexación que habría que construir y mantener.