SITUATION EXPLAINED: Anthropic just deliberately made Sonnet 5 worse at cybersecurity than its predecessor. • Sonnet 5 underperforms Opus on every benchmark except GDPval, where it scores 1618 vs Opu…
Este tweet proporciona información crítica sobre el lanzamiento del nuevo modelo Sonnet 5 de Anthropic, incluyendo su rendimiento comparativo en ciberseguridad y otras métricas. Es valioso para equipos técnicos avanzados ya que afecta directamente a la elección y utilización de modelos de IA en producción, especialmente considerando los cambios intencionales en las capacidades cibernéticas.