GAIL Study Hub

1. El problema de negocio

El área de riesgos de un banco quiere que sus analistas consulten expedientes de crédito empresarial muy extensos que combinan informes en texto, balances escaneados y grabaciones en vídeo de las reuniones con el cliente. Necesitan resúmenes y respuestas razonadas sobre el expediente completo, dentro del entorno cloud gestionado que el banco ya usa. El comité de tecnología debe decidir qué modelo de Google adoptar y en qué gama.

2. Solución de Google

Servicio
Gemini en la gama adecuada, o Gemma cuando hay que controlar los pesos
Capa
Modelos
Por qué
Gemini es multimodal nativo: interpreta en un mismo modelo el texto, los balances escaneados y los vídeos del expediente. La gama Pro aporta el razonamiento complejo y la ventana de contexto que pide un expediente extenso, en el entorno gestionado que el banco ya usa. Gemma solo compensaría si el banco necesitara controlar los pesos del modelo.
Ver la capa en el mapa de 5 capas
Las 5 capas del panorama de IA generativa: arriba, lo más cercano al usuario; abajo, la infraestructura.
  1. Capa 5Aplicaciones

    La parte con la que interactúa el usuario final.

    • Gemini app
    • Gemini Enterprise
    • Gemini for Google Workspace
    • Gemini Notebook
    • Gemini for Google Cloud
  2. Capa 4Agentes

    Software que persigue un objetivo usando un modelo y herramientas.

    • Agentes en Agent Platform
    • Customer Engagement Suite
  3. Capa 3Plataforma

    APIs, gestión de datos y despliegue de modelos; abstrae la infraestructura.

    • Agent Studio
    • Agent Search
    • Model Garden
    • Agent Platform AutoML
    • RAG Engine
    • Agent Runtime
  4. Capa 2Modelos[Capa de esta lección]

    Algoritmos entrenados con grandes volúmenes de datos que generan contenido.

    • Gemini
    • Gemma
    • Imagen
    • Veo
  5. Capa 1Infraestructura

    Cómputo y almacenamiento físico para entrenar y servir modelos.

    • AI Hypercomputer
    • Cloud TPU
    • GPU
    • Centros de datos de Google

3. Límites

No la uses si
La tarea pasa a ser sencilla y masiva, como resumir cientos de miles de mensajes breves al día, y el coste por consulta decide la viabilidad.
Variable que fuerza el cambio
Coste
Alternativa
Gemini Flash-Lite, la gama para volumen masivo a mínimo coste; si el modelo tuviera que ejecutarse en el propio dispositivo, IA en el edge con Gemini Nano y LiteRT.

4. La trampa del examen

[✗] Distractor
Usar Imagen para interpretar los balances escaneados y Veo para analizar las grabaciones en vídeo, un modelo especializado para cada modalidad.
Por qué tienta
Imagen y Veo son los modelos de Google asociados a la imagen y al vídeo, y repartir el trabajo por modalidad parece más especializado.
Por qué es incorrecto
Imagen y Veo generan imágenes y vídeo, no los interpretan; entender balances y grabaciones y razonar sobre ellos corresponde a un modelo multimodal nativo como Gemini, que además evita el esfuerzo de integrar varios modelos.

5. Micro-check