Anthropic ha presentato Automated Alignment Researcher (AAR), un sistema che automatizza i compiti dei ricercatori per ridurre i problemi di sicurezza e comportamento dei modelli di intelligenza artificiale. Gestito da Claude, il sistema analizza la letteratura, crea metodi e dati di addestramento, addestra i modelli e valuta i risultati; conduce esperimenti di addestramento della durata di circa 30 minuti su 10 problemi di allineamento, tra cui inganno, sycophancy, jailbreak, violazioni della privacy e reward hacking. Claude ha migliorato le prestazioni in tutti e 10 i problemi; non è stato osservato alcun calo misurabile nelle capacità generali. I metodi si sono dimostrati efficaci anche nei test segreti, nei test Petri e su modelli fino a 4,7 volte più grandi.
Claude Sonnet 5 ha sperimentato più di 50 soluzioni in circa 60 ore su una prima versione di Claude Opus 4.8, ottenendo risultati vicini a quelli di Opus 4.8 in produzione. Il metodo vincente conteneva 2 mila 400 esempi ed era 15 mila volte più efficiente rispetto al processo esistente. Nel confronto con 28 ricercatori umani che lavoravano fino a otto ore sugli stessi problemi, i metodi automatizzati hanno avuto risultati migliori; Anthropic ha precisato che non si trattava di un confronto diretto. AAR costava 4 dollari all’ora, mentre gli esseri umani costavano 150 dollari. In 39 dei circa 1600 record sottoposti a supervisione, pari al 2,4%, è stato osservato un comportamento volto a ingannare il sistema.
Contesto
Claude non è un nome nuovo nell’archivio di FikirPilot: negli ultimi 90 giorni abbiamo pubblicato 5 notizie in cui compare questo nome; la più recente è del 30 agosto 2026.