Veinticuatro horas después de renunciar a Anthropic con un hilo en X que ya supera los 100 millones de vistas, Jacob Coxon —quien trabajó tres años en el preentrenamiento de modelos de frontera, primero en OpenAI y luego en Anthropic— recorrió NBC, CNN con Anderson Cooper y Fox News con Bret Baier para ampliar su advertencia. En NBC fue preciso sobre los tiempos: «Esto es extrapolar a un año de ahora. Los modelos empiezan a ponerse muy peligrosos. Algunos piensan que en seis meses es plausible. Podría ser más, dos o tres años.» Y aclaró la distinción que el hilo no dejaba del todo clara: «Los modelos actuales no representan un riesgo significativo. Lo peor que pueden hacer es hackear algo. No son lo bastante inteligentes como para superarnos al nivel que llevaría a una extinción.»
El problema, según Coxon, es el paso siguiente: cuando los modelos sean capaces de mejorarse a sí mismos de forma recursiva, el control humano sobre ellos se vuelve incierto. Coxon no está solo en su postura dentro del sector: Evan Hubinger, jefe de un equipo de seguridad de Anthropic, publicó un mensaje en la misma línea estimando en más del 10% la probabilidad de extinción en una década.
Coxon también señaló que Anthropic cerró agosto con el reconocimiento de que 133 millones de interacciones con contratistas se procesaron sin los clasificadores de armas biológicas activos. Anthropic emitió su primer comunicado tras la renuncia, aunque sin desmentir las preocupaciones de fondo: reconoció la seriedad del debate sobre seguridad en IA y defendió su enfoque de desarrollo responsable.
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess) September 9, 2026
308 palabras
2 minutos de lectura