Reddit despliega LLMs propios contra spam de IA generada
Reddit ha revelado un sistema de detección basado en modelos de lenguaje que bloquea 23 millones de visualizaciones de spam diarias, elimina 25.000 publicaciones y comentarios, y revoca 2 millones de votos falsos cada 24 horas.
Reddit ha hecho públicos los números de su operación interna de moderación mediante inteligencia artificial, una herramienta que se convirtió en prioritaria conforme la plataforma vio crecer el flujo de contenido generado automáticamente. El sistema, basado en modelos de lenguaje propios, funciona en tiempo real sobre el volumen masivo de posts, comentarios y interacciones que generan millones de usuarios diarios.
Las cifras son significativas. El sistema bloquea 23 millones de visualizaciones de spam cada día, lo que significa que intercepta contenido malicioso antes de que alcance la escala. Simultáneamente, elimina alrededor de 25.000 publicaciones y comentarios diarios identificados como generados por máquina o diseñados para manipular. Además revoca aproximadamente 2 millones de votos inauténticos en el mismo período: upvotes y downvotes automatizados que distorsionan el sistema de ranking de la plataforma.
Lo que hace distintivo este enfoque es que Reddit no subcontrata a proveedores de seguridad externos, sino que construyó y opera sus propios modelos. Esto le permite ajustar criterios, aprender de falsos positivos, y adaptarse rápidamente a nuevos patrones de spam. Es una apuesta por autonomía técnica: en lugar de depender de APIs externas o servicios genéricos de detección, Reddit controla la cadena completa.
El contexto es paradójico: Reddit fue uno de los primeros espacios donde empresas de IA entrenaron sus modelos masivamente, usando posts de usuarios sin consentimiento explícito. Ahora usa esa misma tecnología para limpiar la suciedad que genera. La plataforma se enfrenta a un problema práctico: no puede moderar manualmente millones de publicaciones diarias, pero tampoco puede permitir que bots inunden los subreddits con ruido.
El desafío oculto es el equilibrio entre precisión y cobertura. Un LLM de detección debe identificar spam generado por máquina sin castigar a usuarios genuinos que usan lenguaje informal o repetitivo. Revocaciones masivas de votos pueden afectar dinámicas legales de comunidad. Reddit publicó números agregados pero no reveló tasas de falsos positivos o controversias internas sobre borrados. Eso deja preguntas sin respuesta.
Lo que esperar es que otras plataformas sigan el mismo camino: construir sistemas internos de detección basados en LLMs. Twitter/X, TikTok y YouTube ya tienen algoritmos de moderación, pero el uso explícito de agentes lingüísticos contra contenido generado por máquinas es más nuevo. También veremos probablemente discusiones sobre transparencia: qué se modera, por qué, y cómo apelar. Reddit abrió la puerta a que la industria reporte estas métricas.
Ver la fuente original ↗