Gemini 3.5 Flash integra Computer Use nativo
Google ha actualizado Gemini 3.5 Flash con Computer Use, una capacidad que permite a la IA ver, razonar y ejecutar acciones autónomas en navegadores, ordenadores y dispositivos móviles. La función responde a una solicitud recurrente de la comunidad de desarrolladores.
Google ha añadido a su modelo Gemini 3.5 Flash una capacidad que los desarrolladores llevaban reclamando desde que se popularizó Computer Use en otros asistentes. La integración nativa de Computer Use en Flash permite que el modelo no solo procese texto e imágenes, sino que vea la pantalla en tiempo real y tome decisiones sobre qué acciones ejecutar: pulsar botones, escribir en campos, navegar enlaces, sin intervención humana entre medias.
La importancia técnica radica en que Computer Use no es simplemente visión+lenguaje. Requiere que el modelo combine comprensión de interfaz gráfica, razonamiento sobre consecuencias de acciones y corrección de errores en bucle cerrado. Cuando un agente comete un paso equivocado, debe detectarlo visualmente, entender el problema y reorientarse. Eso es razonamiento secuencial que hasta hace poco era débil en modelos menores.
Gemini 3.5 Flash es un modelo diseñado para ser rápido y eficiente en inferencia; no es GPT-4o ni Claude 3.5 Sonnet en capacidad bruta. Que Google haya conseguido que Computer Use funcione en este modelo más ligero sugiere que la capacidad se ha optimizado bien. Para desarrolladores, esto significa poder desplegar agentes inteligentes sin costes de inferencia astronómicos, algo que hasta ahora limitaba mucho el uso real fuera de demos.
El contexto aquí es de competencia clara. OpenAI lanzó Computer Use con GPT-4o hace meses, Claude 3.5 Sonnet también lo tiene. Google estaba rezagado en esta carrera específica. Añadirlo ahora a Flash, su modelo más ágil, es una jugada defensiva pero también ofensiva: cubre su debilidad y abre el acceso a desarrolladores que no pueden permitirse inferencias caras.
Hay límites evidentes que no desaparecen. Computer Use sigue siendo más lento que un humano en muchas tareas de navegación compleja. La tasa de alucinación en contextos visuales ruidosos sigue siendo problemática. Y el modelo puede atascarse en bucles de intentos fallidos sin capacidad real de razonamiento de orden superior para romper el patrón. Esto es herramienta, no sustituto de automatización real.
Qué esperar: una explosión de aplicaciones de RPA automático basado en IA. Startups y empresas van a comenzar a experimentar reemplazando macros y scripts antiguos con agentes de Computer Use que sean más adaptativos. Google probablemente liberará esta capacidad en Vertex AI y en la API de Gemini en las próximas semanas para desarrolladores pagos. La carrera por optimizar Computer Use en modelos menores acaba de acelerarse.
Ver la fuente original ↗