Matriz de decisión
Cuándo gana una API especializada frente a la IA generativa, y cuándo conviene RAG, la ventana de contexto con caché o el fine-tuning. Todo razonado con variables de negocio.
Cuadrante de colisión
Cada caso enfrenta la solución canónica con el distractor que suele aparecer en el examen. Es una heurística, no un dogma: la variable frontera indica qué cambiaría la decisión.
Filtrar por variable frontera
Una organización necesita extraer de forma masiva los datos de facturas y formularios con un formato estándar y repetitivo.
- Solución canónica
- [✓] Document AI API
- Distractor frecuente
- [✗] LLM generalista procesando cada documento
- Variable frontera
- Volumen de usuarios o datos
- Por qué
- El esquema de estos documentos es estable y el volumen es alto, por lo que una API especializada entrega una salida estructurada predecible con un coste por página menor que el de un modelo generalista.
Una organización necesita traducir su catálogo de forma masiva y a bajo coste.
- Solución canónica
- [✓] Translation API / Document Translation API (si hay que conservar el formato)
- Distractor frecuente
- [✗] Gemini Pro
- Variable frontera
- Coste
- Por qué
- Manda el coste unitario: la API especializada es la opción para traducir a gran volumen. Gemini Pro se justifica cuando se busca transcreación o respetar el tono de marca.
Una organización quiere conocer el sentimiento y los motivos de contacto en todo el histórico de su contact center.
- Solución canónica
- [✓] Conversational Insights (Customer Engagement Suite)
- Distractor frecuente
- [✗] Pipeline propio Speech-to-Text + LLM
- Variable frontera
- Plazo de entrega
- Por qué
- Conversational Insights es el producto gestionado de este dominio: analiza las conversaciones a escala, con su sentimiento y sus motivos de contacto, sin construir nada. Un pipeline propio de Speech-to-Text y un LLM obliga a construir lo que el producto ya ofrece.
Una organización atiende un canal telefónico con flujos regulados que incluyen pasos obligatorios.
- Solución canónica
- [✓] Conversational Agents (determinista o híbrido)
- Distractor frecuente
- [✗] Agente puramente generativo
- Variable frontera
- Esfuerzo operativo
- Por qué
- La variable real es el determinismo: los pasos regulados exigen flujos predefinidos. La parte generativa queda para las preguntas abiertas, y combinar ambas cosas da un agente híbrido.
Una organización quiere ayudar en directo a sus teleoperadores humanos.
- Solución canónica
- [✓] Agent Assist
- Distractor frecuente
- [✗] Chatbot autónomo
- Variable frontera
- Esfuerzo operativo
- Por qué
- La variable real es el rol humano: Agent Assist ayuda en tiempo real al teleoperador con sugerencias, resúmenes y artículos, pero no lo sustituye. Un chatbot autónomo, en cambio, lo sustituye.
Una organización necesita clasificar millones de registros que ya tiene almacenados en su data warehouse.
- Solución canónica
- [✓] Funciones generativas de BigQuery (SQL)
- Distractor frecuente
- [✗] Exportar a scripts externos
- Variable frontera
- Esfuerzo operativo
- Por qué
- La clasificación se hace in situ: las funciones generativas de BigQuery llaman a Gemini desde SQL sin sacar los datos del almacén, al alcance de los analistas SQL. Exportar a scripts externos obliga a mover los datos.
Un equipo consulta un expediente extenso y cerrado varias veces a lo largo de la misma jornada, sin que el contenido cambie entre una consulta y la siguiente.
- Solución canónica
- [✓] Gemini con context caching
- Distractor frecuente
- [✗] Un pipeline RAG completo
- Variable frontera
- Coste
- Por qué
- El expediente se reutiliza muchas veces en la misma sesión, así que el caché de contexto reduce el coste de las consultas repetidas frente a construir un pipeline RAG completo; para una consulta única bastaría el prompt estándar, sin caché.
Una organización necesita un buscador para miles de empleados sobre una documentación que cambia a diario.
- Solución canónica
- [✓] Agent Search / Gemini Enterprise
- Distractor frecuente
- [✗] Caché de contexto o fine-tuning
- Variable frontera
- Frescura del dato
- Por qué
- Deciden el volumen, la frescura del dato, porque la documentación cambia a diario, y la concurrencia de miles de empleados. Agent Search ofrece búsqueda y RAG gestionado sobre datos corporativos.
Un gestor de producto quiere probar variaciones de un prompt en cuestión de minutos, usando su cuenta personal y sin depender de un proyecto corporativo.
- Solución canónica
- [✓] Google AI Studio
- Distractor frecuente
- [✗] Agent Studio
- Variable frontera
- Plazo de entrega
- Por qué
- Lo que prima es la velocidad de entrada: probar la idea sin crear un proyecto, sin IAM corporativo ni facturación empresarial. Agent Studio añade justo esa gobernanza, que aquí solo ralentizaría el prototipo.
Una organización necesita un bot de producción que funcione con IAM, VPC Service Controls y SLA.
- Solución canónica
- [✓] Agent Studio / Agent Platform
- Distractor frecuente
- [✗] Google AI Studio
- Variable frontera
- Esfuerzo operativo
- Por qué
- La variable real es la gobernanza enterprise: Agent Studio despliega aplicaciones de producción con IAM y SLA. Google AI Studio sirve para prototipar y no ofrece VPC Service Controls, IAM corporativo ni SLA.
Una organización necesita un modelo que se ejecute en sus propios servidores, sin conexión.
- Solución canónica
- [✓] Gemma (pesos abiertos)
- Distractor frecuente
- [✗] Gemini vía API pública
- Variable frontera
- Esfuerzo operativo
- Por qué
- Las variables reales son la soberanía y la conectividad: Gemma tiene pesos descargables y se despliega en local. Frontera: si el cliente dispone de Google Distributed Cloud air-gapped, Gemini también puede ejecutarse allí.
Una empresa necesita detectar y filtrar información personal identificable antes de que los prompts salgan hacia el modelo, cubriendo formatos y países distintos.
- Solución canónica
- [✓] Sensitive Data Protection
- Distractor frecuente
- [✗] Expresiones regulares caseras
- Variable frontera
- Esfuerzo operativo
- Por qué
- Los detectores gestionados de Sensitive Data Protection cubren tipos de PII muy diversos con validación continua, mientras que mantener expresiones regulares propias exige un esfuerzo operativo creciente cada vez que aparece un formato nuevo de dato personal.
Una organización necesita acreditar la procedencia de las imágenes generadas con IA.
- Solución canónica
- [✓] SynthID
- Distractor frecuente
- [✗] Metadatos EXIF
- Variable frontera
- Esfuerzo operativo
- Por qué
- La variable real es la robustez: SynthID es una marca de agua imperceptible que sobrevive a las ediciones de la imagen, mientras que los metadatos EXIF se borran.
Ninguna colisión de la lista depende de esta variable.
Trío de adaptación
RAG, ventana de contexto con caché y fine-tuning resuelven problemas distintos. La tabla compara las tres opciones con las mismas variables de negocio.
La caché de contexto es contenido de [Ampliación]: no figura en el exam guide, pero ayuda a razonar frente a RAG.
| Variable | RAG / Agent Search | Ventana de contexto + context caching | Fine-tuning |
|---|---|---|---|
| Coste | Pagas por mantener el índice y por cada búsqueda. Compensa cuando el corpus es grande y se consulta a menudo. | Pagas por mantener el contexto en caché. Compensa solo si el mismo contexto se reutiliza muchas veces; una consulta única no se beneficia. | Inversión inicial en preparar ejemplos y ajustar el modelo, más su mantenimiento. Se justifica por un comportamiento que el prompt no consigue. |
| Plazo de entrega | Días o semanas con Agent Search gestionado; meses si se construye a medida. | Inmediato: el corpus se envía en el prompt, sin indexar ni entrenar. | El más lento: hay que reunir ejemplos de calidad, ajustar y evaluar antes de producción. |
| Frescura del dato | La mejor opción: el índice se actualiza cuando cambian los documentos y las respuestas pueden citar la fuente. | Válida mientras el corpus no cambie; si cambia, hay que volver a cargarlo. | Ninguna: lo aprendido queda fijo en el modelo. Nunca sirve para mantener datos actualizados. |
| Volumen de usuarios o datos | Escala a corpus que no caben en la ventana de contexto y a miles de usuarios concurrentes. | Limitada a un corpus acotado que cabe en la ventana de contexto. | No depende del volumen de consultas, sino de disponer de suficientes ejemplos del comportamiento deseado. |
| Esfuerzo operativo | Bajo con Agent Search, que es gestionado; alto si se montan a mano el índice y la recuperación. | Mínimo: no hay índice que mantener, solo decidir qué contexto se reutiliza. | Alto: hay que mantener los datos de ajuste y repetir ajuste y evaluación cuando cambian los requisitos. |
| Cuándo NO usarla | Si el corpus es acotado y se reutiliza en sesiones de análisis (mejor ventana de contexto con caché) o si lo que falla es el tono o el formato (mejor fine-tuning). | Si los datos cambian a menudo, no caben en la ventana de contexto o los consultan miles de usuarios (mejor RAG / Agent Search), o si es una consulta única. | Para aportar conocimiento factual o que cambia (mejor RAG / Agent Search). Resérvalo para tono, estilo o formato de salida rígido. |