Chrome 148 ya puede ejecutar un modelo de IA dentro de tus pestañas — sin API key ni nube
Todos asumen que la IA en el navegador necesita un servidor y una API key. Chrome 148 incluye Gemini Nano directamente en el navegador, así que la inferencia corre en tu propia máquina: sin conexión, privada y rápida.
01. Qué Es
Chrome 148, lanzado el 5 de mayo de 2026, expone una nueva Prompt API que permite a las páginas web y extensiones comunicarse con Gemini Nano —el modelo de lenguaje liviano de Google que corre en el dispositivo— sin hacer ninguna petición a la red. En lugar de enviar el texto a un endpoint en la nube, el modelo se ejecuta directamente en el hardware de tu computadora.
Como no hay llamada a un servidor, no hay API key que gestionar, no hay cobro por petición y ningún dato sale de tu equipo. La primera vez que un sitio usa la API, Chrome descarga el modelo una sola vez (aproximadamente 2–4 GB) y, a partir de ahí, la inferencia ocurre localmente, incluso sin conexión. Está optimizado para tareas puntuales de un solo turno como resumir, reescribir y traducir textos cortos.
Esto rompe una suposición común: la mayoría cree que toda 'función de IA' en un sitio web depende de un servidor remoto. La Prompt API de Chrome demuestra que el propio navegador puede ser el motor de IA, lo que cambia por completo el costo, la latencia y la privacidad para toda una categoría de tareas pequeñas.
Por Qué Importa
Para tareas pequeñas del día a día —limpiar una nota, resumir un párrafo, reescrituras rápidas— obtienes resultados instantáneos y privados con costo cero en la nube. Los desarrolladores se ahorran las facturas de API por completo y los usuarios conservan su texto en su propia máquina. Como corre sin conexión, también funciona en un avión o con internet inestable.
Quién Puede Beneficiarse
- Desarrolladores web que quieren IA barata y privada para funciones ligeras sin pagar por token
- Usuarios preocupados por la privacidad que no quieren enviar su texto a servidores en la nube
- Creadores de extensiones que necesitan inferencia en el dispositivo que siga funcionando sin conexión
- Curiosos que quieren experimentar con un LLM local directamente desde la consola del navegador
02. Guía Paso a Paso
- 1
Confirma que tienes Chrome 148+ oficial en un escritorio compatible
Esto solo funciona en la versión oficial de Google Chrome, 148 o superior, en Windows 10+, macOS 13+ o Linux. NO funciona en Android, iOS, ChromeOS ni en builds de Chromium empaquetados por distribuciones. Verifica tu versión en chrome://version.
- 2
Asegúrate de cumplir los requisitos de hardware y almacenamiento
Necesitas al menos 10 GB de espacio libre en disco (el modelo se borra automáticamente si el espacio libre baja luego de los 10 GB). Se recomienda una GPU con 4+ GB de VRAM para inferencia rápida; sin ella, Chrome usa la CPU, que funciona pero es más lenta.
- 3
Activa el flag del modelo en el dispositivo
Ve a chrome://flags/#optimization-guide-on-device-model y ponlo en 'Enabled'. Esto le indica a Chrome que puede descargar y ejecutar el modelo local.
- 4
Activa el flag de la Prompt API
Ve a chrome://flags/#prompt-api-for-gemini-nano y ponlo en 'Enabled'. Luego haz clic en 'Relaunch' para reiniciar Chrome con ambos flags activos.
- 5
Dispara la descarga única del modelo
Abre DevTools (F12) → Consola y llama a la API por primera vez (por ejemplo, crea una sesión de modelo de lenguaje). Chrome descarga Gemini Nano en segundo plano: es una descarga única de 2–4 GB. Cuando termine, todas las llamadas futuras corren localmente.
- 6
Ejecuta un prompt puntual de forma local
Usa la API para tareas cortas de un solo turno como resumir o reescribir un párrafo. Mantén tu entrada por debajo de unos 2,000 tokens para buenos resultados: es un modelo pequeño afinado para tareas específicas, no para razonamiento profundo.
Consejos Pro
- Mantén los prompts cortos y con un solo objetivo: resume esto, reescribe esto de forma más formal, traduce esta frase. El modelo brilla en tareas puntuales y falla con las largas o abiertas.
- Para un sitio web real (no solo pruebas locales), los flags no ayudan a tus visitantes: registra un token de Origin Trial para tu dominio o distribuye tu función como extensión de Chrome, que también puede usar la API dentro de su ServiceWorker.
- Desde Chrome 149 el modelo maneja inglés, español, japonés, alemán y francés, así que puedes crear funciones ligeras de reescritura y traducción multilingües en el dispositivo.
- Como todo corre localmente, sigue funcionando sin conexión: ideal para limpiar notas o reescribir borradores en un vuelo.
Advertencias y Limitaciones
- Gemini Nano es un modelo pequeño: no confíes en él para precisión factual, razonamiento profundo, análisis de contexto largo o generación de código. Usa modelos en la nube para eso.
- La ventana de contexto es de solo unos 2,000 tokens de entrada: superarla degrada notablemente la calidad, así que divide los textos largos tú mismo.
- Solo escritorio. No hay soporte en Android, iOS ni ChromeOS, y requiere el build oficial de Chrome, no Chromium empaquetado.
- En Chrome 148 la API no está disponible en Web Workers, Shared Workers ni en ServiceWorkers de página (aunque sí funciona en los ServiceWorkers de extensiones).
- Si tu espacio libre en disco baja de 10 GB después de la descarga, Chrome elimina el modelo y tendrás que volver a descargarlo cuando haya espacio.
Trucos Relacionados
Casi ningún usuario de Android sabe que Gemini puede crear widgets con una sola frase
Describe el widget que quieres en lenguaje natural y Gemini lo diseña, lo construye y lo instala en tu pantalla de inicio, sin ajustes ni menús.

La mayoría de usuarios de Claude no ven este ícono fantasma que apaga la memoria al instante
Claude agregó discretamente un modo Incógnito que se salta la memoria por completo: sin historial, sin resúmenes de memoria, sin entrenamiento. Es una salida de privacidad de un clic escondida a plena vista.
La mayoría de usuarios de Claude no sabe que puede consultar tu base de datos en vivo
Deja de exportar CSVs y pegar resultados de consultas. Claude ahora puede conectarse directamente a tu base de datos PostgreSQL o MySQL y ejecutar consultas de solo lectura en tiempo real, analizando datos de producción sin salir del chat.
