El Frente
Detección y moderación

Reddit despliega LLMs propios contra spam de IA generada

Por la redacción de El Frente
Reddit despliega LLMs propios contra spam de IA generada

Reddit ha revelado un sistema de detección basado en modelos de lenguaje que bloquea 23 millones de visualizaciones de spam diarias, elimina 25.000 publicaciones y comentarios, y revoca 2 millones de votos falsos cada 24 horas.

Reddit ha hecho públicos los números de su operación interna de moderación mediante inteligencia artificial, una herramienta que se convirtió en prioritaria conforme la plataforma vio crecer el flujo de contenido generado automáticamente. El sistema, basado en modelos de lenguaje propios, funciona en tiempo real sobre el volumen masivo de posts, comentarios y interacciones que generan millones de usuarios diarios.

Las cifras son significativas. El sistema bloquea 23 millones de visualizaciones de spam cada día, lo que significa que intercepta contenido malicioso antes de que alcance la escala. Simultáneamente, elimina alrededor de 25.000 publicaciones y comentarios diarios identificados como generados por máquina o diseñados para manipular. Además revoca aproximadamente 2 millones de votos inauténticos en el mismo período: upvotes y downvotes automatizados que distorsionan el sistema de ranking de la plataforma.

Lo que hace distintivo este enfoque es que Reddit no subcontrata a proveedores de seguridad externos, sino que construyó y opera sus propios modelos. Esto le permite ajustar criterios, aprender de falsos positivos, y adaptarse rápidamente a nuevos patrones de spam. Es una apuesta por autonomía técnica: en lugar de depender de APIs externas o servicios genéricos de detección, Reddit controla la cadena completa.

El contexto es paradójico: Reddit fue uno de los primeros espacios donde empresas de IA entrenaron sus modelos masivamente, usando posts de usuarios sin consentimiento explícito. Ahora usa esa misma tecnología para limpiar la suciedad que genera. La plataforma se enfrenta a un problema práctico: no puede moderar manualmente millones de publicaciones diarias, pero tampoco puede permitir que bots inunden los subreddits con ruido.

El desafío oculto es el equilibrio entre precisión y cobertura. Un LLM de detección debe identificar spam generado por máquina sin castigar a usuarios genuinos que usan lenguaje informal o repetitivo. Revocaciones masivas de votos pueden afectar dinámicas legales de comunidad. Reddit publicó números agregados pero no reveló tasas de falsos positivos o controversias internas sobre borrados. Eso deja preguntas sin respuesta.

Lo que esperar es que otras plataformas sigan el mismo camino: construir sistemas internos de detección basados en LLMs. Twitter/X, TikTok y YouTube ya tienen algoritmos de moderación, pero el uso explícito de agentes lingüísticos contra contenido generado por máquinas es más nuevo. También veremos probablemente discusiones sobre transparencia: qué se modera, por qué, y cómo apelar. Reddit abrió la puerta a que la industria reporte estas métricas.

Basado en información de: Wwwhat's new.
Ver la fuente original ↗

← Portada Más de Chats →

Más señales de Chats

Todo lo que puedes hacer con OpenClaw gracias a su app para iPhone y Android
Chatsnuevo

Todo lo que puedes hacer con OpenClaw gracias a su app para iPhone y Android

OpenClaw es un agente de IA o agente personal de inteligencia artificial. Entre sus principales ventajas, es de código abierto y puedes instalarlo y ejecutarlo directamente en tu ordenador o dispos…

El FrenteLeer
OpenAI frena el desarrollo de su modelo más potente y activa alertas automáticas en 30 minutos: las nuevas salvaguardas tras el hackeo a Hugging Face
Chats

OpenAI frena el desarrollo de su modelo más potente y activa alertas automáticas en 30 minutos: las nuevas salvaguardas tras el hackeo a Hugging Face

El incidente más extraño de la historia reciente de la IA tiene hoy su capítulo de consecuencias. OpenAI anuncia este martes 18 de agosto un paquete de nuevas medidas de seguridad que cambian la fo…

El FrenteLeer
Anthropic añade una marca de agua invisible a todo lo que escribe Claude — y algunos usuarios cancelaron su suscripción
Chats

Anthropic añade una marca de agua invisible a todo lo que escribe Claude — y algunos usuarios cancelaron su suscripción

Desde el 2 de agosto de 2026, cada texto generado por los nuevos modelos Claude lleva una marca de agua invisible que no puedes ver pero que puede detectarse con las herramientas adecuadas. Anthrop…

El FrenteLeer

Explora por tema

ChatsModelosBioCómputoCienciaLímites