Anche Kimi K3 esce dalla sandbox, ma senza conseguenze

Anche Kimi K3 esce dalla sandbox, ma senza conseguenze

A causa di un errore di configurazione, Kimi K3 è uscito dalla sandbox e trovato la soluzione del compito assegnato in un repository di GitHub.
Anche Kimi K3 esce dalla sandbox, ma senza conseguenze
A causa di un errore di configurazione, Kimi K3 è uscito dalla sandbox e trovato la soluzione del compito assegnato in un repository di GitHub.

I ricercatori di Frontier Security affermano che Kimi K3 è uscito dall’ambiente di test dell’AI Safety Institute, sfruttando un errore di configurazione. La fuga dalla sandbox è simile a quella effettuata dai modelli di OpenAI, Anthropic e Meta. Sembra che gli agenti AI non vogliano più rimanere in gabbia, ma girare liberamente su Internet.

Nessun attacco contro aziende esterne

Kimi K3 è l’ultimo modello open source della cinese Moonshot e offre prestazioni molto vicine a quella di Claude Fable 5 (Anthropic) e GPT-5.6 Sol (OpenAI). I ricercatori di Frontier Security hanno descritto come sia riuscito ad aggirare le protezioni, evidenziando la maggiore pericolosità rispetto ai modelli concorrenti perché è liberamente accessibili a tutti, cybercriminali inclusi.

La valutazione delle capacità cyber viene solitamente effettuata con sfide “capture the flag” all’interno di ambienti isolati, come quello usato dall’AI Safety Institute. Viene assegnato un compito che il modello deve risolvere in autonomia, ovvero catturare la bandiera (flag).

In questo caso, Kimi K3 ha sfruttato un errore di configurazione della rete (non una vulnerabilità software) per uscire dalla sandbox, accedere ad Internet e trovare la soluzione in un repository di GitHub. Il traffico in ingresso era bloccato, mentre le porte 443 (HTTPS) e 53 (DNS) erano rimaste aperte. Il modello ha quindi trovato l’uscita e clonato il repository ufficiale del benchmark Cybench, in cui era presente la soluzione al problema assegnato.

I ricercatori sottolineano che la valutazione dei modelli è significativa solo quando l’ambiente di test impedisce l’accesso a risposte e altre scorciatoie indesiderate. È quindi necessario controllare attentamente che non ci siano “buchi” nella configurazione di rete dell’ambiente di test. Fortunatamente, a differenza dei modelli di OpenAI, Anthropic e Meta, Kimi K3 non ha attaccato nessuna azienda esterna.

Link copiato negli appunti

Ti potrebbe interessare

Pubblicato il
7 ago 2026
Link copiato negli appunti