El Frente
Chats

Gemini 3.5 Flash integra Computer Use nativo

Por la redacción de El Frente
Gemini 3.5 Flash integra Computer Use nativo

Google ha actualizado Gemini 3.5 Flash con Computer Use, una capacidad que permite a la IA ver, razonar y ejecutar acciones autónomas en navegadores, ordenadores y dispositivos móviles. La función responde a una solicitud recurrente de la comunidad de desarrolladores.

Google ha añadido a su modelo Gemini 3.5 Flash una capacidad que los desarrolladores llevaban reclamando desde que se popularizó Computer Use en otros asistentes. La integración nativa de Computer Use en Flash permite que el modelo no solo procese texto e imágenes, sino que vea la pantalla en tiempo real y tome decisiones sobre qué acciones ejecutar: pulsar botones, escribir en campos, navegar enlaces, sin intervención humana entre medias.

La importancia técnica radica en que Computer Use no es simplemente visión+lenguaje. Requiere que el modelo combine comprensión de interfaz gráfica, razonamiento sobre consecuencias de acciones y corrección de errores en bucle cerrado. Cuando un agente comete un paso equivocado, debe detectarlo visualmente, entender el problema y reorientarse. Eso es razonamiento secuencial que hasta hace poco era débil en modelos menores.

Gemini 3.5 Flash es un modelo diseñado para ser rápido y eficiente en inferencia; no es GPT-4o ni Claude 3.5 Sonnet en capacidad bruta. Que Google haya conseguido que Computer Use funcione en este modelo más ligero sugiere que la capacidad se ha optimizado bien. Para desarrolladores, esto significa poder desplegar agentes inteligentes sin costes de inferencia astronómicos, algo que hasta ahora limitaba mucho el uso real fuera de demos.

El contexto aquí es de competencia clara. OpenAI lanzó Computer Use con GPT-4o hace meses, Claude 3.5 Sonnet también lo tiene. Google estaba rezagado en esta carrera específica. Añadirlo ahora a Flash, su modelo más ágil, es una jugada defensiva pero también ofensiva: cubre su debilidad y abre el acceso a desarrolladores que no pueden permitirse inferencias caras.

Hay límites evidentes que no desaparecen. Computer Use sigue siendo más lento que un humano en muchas tareas de navegación compleja. La tasa de alucinación en contextos visuales ruidosos sigue siendo problemática. Y el modelo puede atascarse en bucles de intentos fallidos sin capacidad real de razonamiento de orden superior para romper el patrón. Esto es herramienta, no sustituto de automatización real.

Qué esperar: una explosión de aplicaciones de RPA automático basado en IA. Startups y empresas van a comenzar a experimentar reemplazando macros y scripts antiguos con agentes de Computer Use que sean más adaptativos. Google probablemente liberará esta capacidad en Vertex AI y en la API de Gemini en las próximas semanas para desarrolladores pagos. La carrera por optimizar Computer Use en modelos menores acaba de acelerarse.

Basado en información de: Hipertextual.
Ver la fuente original ↗

← Portada Más de Chats →

Más señales de Chats

Todo lo que puedes hacer con OpenClaw gracias a su app para iPhone y Android
Chatsnuevo

Todo lo que puedes hacer con OpenClaw gracias a su app para iPhone y Android

OpenClaw es un agente de IA o agente personal de inteligencia artificial. Entre sus principales ventajas, es de código abierto y puedes instalarlo y ejecutarlo directamente en tu ordenador o dispos…

El FrenteLeer
OpenAI frena el desarrollo de su modelo más potente y activa alertas automáticas en 30 minutos: las nuevas salvaguardas tras el hackeo a Hugging Face
Chats

OpenAI frena el desarrollo de su modelo más potente y activa alertas automáticas en 30 minutos: las nuevas salvaguardas tras el hackeo a Hugging Face

El incidente más extraño de la historia reciente de la IA tiene hoy su capítulo de consecuencias. OpenAI anuncia este martes 18 de agosto un paquete de nuevas medidas de seguridad que cambian la fo…

El FrenteLeer
Anthropic añade una marca de agua invisible a todo lo que escribe Claude — y algunos usuarios cancelaron su suscripción
Chats

Anthropic añade una marca de agua invisible a todo lo que escribe Claude — y algunos usuarios cancelaron su suscripción

Desde el 2 de agosto de 2026, cada texto generado por los nuevos modelos Claude lleva una marca de agua invisible que no puedes ver pero que puede detectarse con las herramientas adecuadas. Anthrop…

El FrenteLeer

Explora por tema

ChatsModelosBioCómputoCienciaLímites