Tu navegador ya puede ejecutar modelos de IA completos localmente—sin internet

WebGPU llegó silenciosamente a Chrome, Firefox y Safari, permitiendo que un modelo de lenguaje corra dentro de una pestaña. Sin clave de API, sin nube, sin suscripción—y una vez cargado, funciona con la red desconectada.

24 de julio de 20268 min de lectura Verificado por IA · 5 fuentes consultadas
Funciona con:ChromeFirefoxSafariWebGPU

01. Qué Es

Durante años, usar un modelo de IA significaba enviar tu pregunta a un servidor, esperar el viaje de ida y vuelta y, muchas veces, pagar por una clave de API. WebGPU cambia eso. Es una API moderna del navegador que expone el procesador gráfico (GPU) de tu dispositivo a las páginas web, para que las operaciones pesadas detrás de la IA—multiplicaciones de matrices e inferencia de modelos de lenguaje—se ejecuten directamente en tu hardware dentro de una pestaña común.

Cuando abres por primera vez una app de IA basada en WebGPU, esta descarga un conjunto de pesos cuantizados del modelo (archivos de IA comprimidos) y los guarda localmente en el IndexedDB o la Cache API de tu navegador. Los tamaños típicos van desde unos 290MB para un modelo pequeño de 1B hasta cerca de 2GB para modelos más grandes de 8B. Después de esa primera descarga, el modelo vive en tu dispositivo.

Lo más notable: una vez que esos pesos están en caché, la inferencia funciona completamente sin conexión. Puedes desconectar el Wi-Fi, quitar el cable de red y la app sigue generando texto indefinidamente. Nada se envía a un servidor—ni tus prompts ni el modelo salen del navegador.

Por Qué Importa

Esto derriba tres barreras a la vez: costo, conectividad y privacidad. No hay suscripción ni clave de API que pagar—la inferencia ocurre en tu propio dispositivo. Funciona en un avión, en un sótano o en cualquier lugar sin señal luego de la descarga inicial. Y como los prompts y los pesos permanecen locales, el texto sensible nunca toca un servidor de terceros. Con WebGPU ahora presente en cerca del 82% de los navegadores, esto ya no es un experimento—es una capacidad real que está inactiva en la mayoría de las máquinas.

Quién Puede Beneficiarse

  • Usuarios preocupados por la privacidad que no quieren que sus prompts salgan del dispositivo
  • Desarrolladores que prototipan funciones de IA sin pagar por llamadas a APIs
  • Personas con internet inestable o sin conexión que igual quieren asistencia de IA
  • Estudiantes y aficionados que quieren experimentar con LLMs gratis
  • Cualquiera que trabaje con texto confidencial que no puede enviarse a la nube

02. Guía Paso a Paso

  1. 1

    Confirma que tu navegador soporta WebGPU

    Necesitas Chrome 113+, Edge 113+, Firefox 141+ en Windows (145+ en macOS), o Safari 26+ (en iOS 26 / macOS Tahoe 26). La mayoría de las instalaciones recientes ya cumplen—solo asegúrate de estar actualizado.

  2. 2

    Abre una app web de IA basada en WebGPU

    Visita una app de inferencia en el navegador (existen muchas demos de código abierto para correr LLMs cuantizados en la pestaña). No se requiere cuenta ni clave de API—estas apps hacen todo del lado del cliente.

  3. 3

    Elige un modelo del tamaño de tu dispositivo

    Escoge un modelo cuantizado que quepa en tu RAM disponible. Los navegadores suelen tener 4–6GB utilizables, así que modelos de 3B–8B parámetros con cuantización de 4 bits (Q4_0 o Q4_K_M en GGUF) o INT8 ONNX son el techo práctico.

  4. 4

    Espera la configuración inicial

    La primera ejecución descarga los pesos (2–5 minutos para archivos de 290MB–2GB) y compila los shaders de la GPU (unos 10–20 segundos). Esto solo ocurre una vez—ten paciencia la primera vez.

  5. 5

    Comprueba que funciona sin conexión

    Después de que el modelo termine de cargar y responda un prompt, desconecta la red por completo. Envía otro prompt: sigue funcionando. Los pesos ya están en caché local y la inferencia nunca vuelve a necesitar internet.

Consejos Pro

  • Los modelos cuantizados más pequeños (1B–3B) cargan más rápido y usan menos RAM—ideales para laptops viejas o teléfonos.
  • Mantén intactos la pestaña y la caché; borrar los datos de navegación puede eliminar los pesos guardados y forzar una descarga completa.
  • Si tu navegador no tiene WebGPU, la mayoría de las apps recurre a WASM/CPU, pero espera solo 1–3 tokens por segundo frente a la inferencia mucho más rápida en GPU.
  • Guarda la app en favoritos para que abra directo al modelo en caché cuando estés sin conexión.

Advertencias y Limitaciones

  • La primera carga siempre requiere internet para descargar los pesos del modelo—solo los usos posteriores son sin conexión.
  • La calidad del modelo está limitada por su tamaño: un modelo de 8B en 4 bits no igualará a los grandes modelos en la nube en razonamiento complejo.
  • La RAM disponible limita lo que puedes ejecutar; modelos demasiado grandes pueden no cargar o bloquear la pestaña.
  • El soporte de Firefox varía según el sistema operativo (141+ en Windows, 145+ en macOS), y Safari exige las versiones más recientes (iOS 26 / macOS Tahoe 26).
#webgpu#local-ai#offline-ai#privacy#browser#llm
Comparte este truco:

Trucos Relacionados