← Torna al blog
Quando abbiamo iniziato Fiabli abbiamo testato 12 modelli di IA sul rilevamento del phishing: GPT-4 Turbo, Mistral Large, Llama 3.3, Gemini Pro, Claude Haiku/Sonnet/Opus, e diversi modelli specializzati. Dopo 3 mesi di benchmark su 50.000 email reali (40k legittime, 10k phishing confermato), Claude di Anthropic e risultato chiaramente il vincitore. Ecco perche.

Il criterio principale: precisione su dati reali

I benchmark accademici (LLMSec, PhishBench) sono utili ma non sostituiscono dati reali. Abbiamo creato il nostro dataset: 40.000 email legittime di volontari (newsletter, fatture, conversazioni) + 10.000 email di phishing confermate (PhishTank, ApWG, segnalazioni utente).

Risultati Top 3:

  • Claude Sonnet 4.6: 99,7% accuratezza, 0,18% falsi positivi
  • GPT-4 Turbo: 99,3% accuratezza, 0,42% falsi positivi
  • Claude Haiku 4.5: 99,1% accuratezza, 0,29% falsi positivi

Differenza chiave: Claude rileva meglio il phishing sofisticato (spear phishing, BEC) dove il contesto sociale conta piu della firma tecnica.

L'architettura ibrida Haiku + Sonnet

Claude Haiku 4.5 e ~12 volte piu economico di Sonnet 4.6 (~0,80 $/M token vs ~10 $/M token). Per ottimizzare i costi, Fiabli usa un'architettura a due livelli:

  • Tutte le email passano prima per Haiku (analisi rapida)
  • Se la confidenza e nella zona grigia 0,4-0,7, escalation automatica a Sonnet
  • Negli altri casi, decisione finale di Haiku

Risultato: l'80% delle email sono trattate solo da Haiku. Costo medio per analisi: 0,008 €. Con i nostri piani, vogliamo restare profittevoli anche su free, indispensabile per la sostenibilita.

La sicurezza dei dati: Anthropic e la fiducia europea

Punto critico per il phishing: le email sono dati personali, spesso con info sensibili (banche, salute, contratti). Far passare questi dati per un'IA cloud e una decisione importante.

Anthropic offre garanzie forti:

  • Nessun training sui dati clienti API (contrattualmente garantito)
  • Conservazione dei prompt: 30 giorni (logging tecnico) poi cancellazione
  • Conformita SOC 2 Type II + GDPR + HIPAA
  • Possibilita di hosting Europa per i clienti enterprise (in arrivo)

Inoltre, Fiabli redacts (oscura) automaticamente alcune informazioni prima dell'invio (numeri di carta, IBAN completi, password) tramite un layer pre-LLM.

Perche non un modello locale?

Domanda frequente: "Perche non Llama 3.3 8B in self-host?" Abbiamo testato seriamente. Tre conclusioni:

1. Precisione: 92% di accuratezza vs 99% per Claude. Il margine sembra piccolo ma su 1M di analisi/mese, sono 70.000 errori in piu (FN o FP). Inaccettabile.

2. Costo reale: un GPU L40S in self-host costa 2.500 €/mese (TCO). Per il nostro volume attuale, l'API Claude costa 4 volte meno. Diventa interessante solo a 10x il volume.

3. Aggiornamenti: il phishing evolve ogni settimana (nuovi pretesti, nuovi marchi). Le nuove versioni di Claude integrano regolarmente queste evoluzioni. In self-host bisogna riaddestrare.

Quale impatto sull'utente?

Concretamente per te utente:

  • Precisione: meno del 0,3% di falsi positivi. Le tue email legittime non vengono mai bloccate.
  • Velocita: 1,8 secondi di latenza media contro i 4-6 sec di GPT-4.
  • Costo controllato: il piano Free di Fiabli (50 analisi/mese) e profittevole, garantisce la sua sostenibilita a lungo termine.
  • Continua evoluzione: ogni 2 mesi, Anthropic rilascia un Haiku/Sonnet migliorato. Fiabli si aggiorna senza che tu debba fare nulla.

La nostra scommessa

Scegliere Claude di Anthropic non e una scelta marketing, e una scelta tecnica fatta dopo 3 mesi di benchmark. Per ora ci permette di proporre il rilevamento di phishing piu preciso del mercato a un costo che resta accessibile per i privati.

Per provarlo: crea un account Fiabli e analizza le tue prime 50 email gratuitamente. Per testare manualmente l'IA su un'email sospetta, vai alla nostra demo interattiva.

Pronto a proteggere la tua casella?

Crea un account Fiabli gratuitamente. 50 analisi/mese senza carta di credito.

Inizia gratuitamente

Articoli simili