Il criterio principale: precisione su dati reali
I benchmark accademici (LLMSec, PhishBench) sono utili ma non sostituiscono dati reali. Abbiamo creato il nostro dataset: 40.000 email legittime di volontari (newsletter, fatture, conversazioni) + 10.000 email di phishing confermate (PhishTank, ApWG, segnalazioni utente).
Risultati Top 3:
- Claude Sonnet 4.6: 99,7% accuratezza, 0,18% falsi positivi
- GPT-4 Turbo: 99,3% accuratezza, 0,42% falsi positivi
- Claude Haiku 4.5: 99,1% accuratezza, 0,29% falsi positivi
Differenza chiave: Claude rileva meglio il phishing sofisticato (spear phishing, BEC) dove il contesto sociale conta piu della firma tecnica.
L'architettura ibrida Haiku + Sonnet
Claude Haiku 4.5 e ~12 volte piu economico di Sonnet 4.6 (~0,80 $/M token vs ~10 $/M token). Per ottimizzare i costi, Fiabli usa un'architettura a due livelli:
- Tutte le email passano prima per Haiku (analisi rapida)
- Se la confidenza e nella zona grigia 0,4-0,7, escalation automatica a Sonnet
- Negli altri casi, decisione finale di Haiku
Risultato: l'80% delle email sono trattate solo da Haiku. Costo medio per analisi: 0,008 €. Con i nostri piani, vogliamo restare profittevoli anche su free, indispensabile per la sostenibilita.
La sicurezza dei dati: Anthropic e la fiducia europea
Punto critico per il phishing: le email sono dati personali, spesso con info sensibili (banche, salute, contratti). Far passare questi dati per un'IA cloud e una decisione importante.
Anthropic offre garanzie forti:
- Nessun training sui dati clienti API (contrattualmente garantito)
- Conservazione dei prompt: 30 giorni (logging tecnico) poi cancellazione
- Conformita SOC 2 Type II + GDPR + HIPAA
- Possibilita di hosting Europa per i clienti enterprise (in arrivo)
Inoltre, Fiabli redacts (oscura) automaticamente alcune informazioni prima dell'invio (numeri di carta, IBAN completi, password) tramite un layer pre-LLM.
Perche non un modello locale?
Domanda frequente: "Perche non Llama 3.3 8B in self-host?" Abbiamo testato seriamente. Tre conclusioni:
1. Precisione: 92% di accuratezza vs 99% per Claude. Il margine sembra piccolo ma su 1M di analisi/mese, sono 70.000 errori in piu (FN o FP). Inaccettabile.
2. Costo reale: un GPU L40S in self-host costa 2.500 €/mese (TCO). Per il nostro volume attuale, l'API Claude costa 4 volte meno. Diventa interessante solo a 10x il volume.
3. Aggiornamenti: il phishing evolve ogni settimana (nuovi pretesti, nuovi marchi). Le nuove versioni di Claude integrano regolarmente queste evoluzioni. In self-host bisogna riaddestrare.
Quale impatto sull'utente?
Concretamente per te utente:
- Precisione: meno del 0,3% di falsi positivi. Le tue email legittime non vengono mai bloccate.
- Velocita: 1,8 secondi di latenza media contro i 4-6 sec di GPT-4.
- Costo controllato: il piano Free di Fiabli (50 analisi/mese) e profittevole, garantisce la sua sostenibilita a lungo termine.
- Continua evoluzione: ogni 2 mesi, Anthropic rilascia un Haiku/Sonnet migliorato. Fiabli si aggiorna senza che tu debba fare nulla.
La nostra scommessa
Scegliere Claude di Anthropic non e una scelta marketing, e una scelta tecnica fatta dopo 3 mesi di benchmark. Per ora ci permette di proporre il rilevamento di phishing piu preciso del mercato a un costo che resta accessibile per i privati.
Per provarlo: crea un account Fiabli e analizza le tue prime 50 email gratuitamente. Per testare manualmente l'IA su un'email sospetta, vai alla nostra demo interattiva.
Pronto a proteggere la tua casella?
Crea un account Fiabli gratuitamente. 50 analisi/mese senza carta di credito.
Inizia gratuitamente