Blog

Leggi gli ultimi post per rimanere aggiornato/a

Immagine di copertina
Come funziona la tokenizzazione negli LLM: guida a token, BPE e context window

I token sono l’unità fondamentale con cui i modelli di linguaggio (LLM) leggono, elaborano e generano testo. Comprendere cosa sono, come vengono creati attraverso il Byte Pair Encoding (BPE) e come influenzano la context window è essenziale per usare i modelli AI in modo efficiente — e per controllare i costi di inferenza, che oggi sono misurati direttamente in token.

Leggi
Immagine di copertina
YOLOv11: come funziona l'object detection e come implementarlo in Python con Ultralytics

YOLOv11 (You Only Look Once, versione 11) di Ultralytics è uno dei modelli di object detection in tempo reale più efficienti disponibili oggi. A differenza degli approcci a due stadi, YOLO esegue rilevamento e classificazione degli oggetti in una singola passata sulla rete neurale, raggiungendo velocità di inferenza adatte anche al deployment su hardware embedded. In questa guida vediamo come funziona l’architettura e come implementarlo in Python.

Leggi
Immagine di copertina
Generative Engine Optimization (GEO) — Parte 1: guida alla nuova era dell'AI Search

La GEO (Generative Engine Optimization) è la nuova disciplina che ottimizza i contenuti web per essere selezionati, citati e riutilizzati dai motori di ricerca basati su intelligenza artificiale generativa. A differenza della SEO tradizionale — che punta a comparire nei risultati di Google — la GEO mira a diventare la fonte che ChatGPT, Gemini, Perplexity e Copilot usano per rispondere alle domande degli utenti. In questa prima parte della guida, esploriamo i fondamenti di questa nuova era dell’AI Search.

Leggi
Immagine di copertina
Come eseguire Ollama su OpenShift: deploy di LLM in ambienti Kubernetes sicuri

Ollama su OpenShift permette di eseguire modelli di linguaggio di grandi dimensioni (LLM) direttamente in un ambiente Kubernetes enterprise, senza dipendenze da API cloud esterne. Questo approccio è particolarmente rilevante in contesti dove privacy dei dati, conformità normativa e controllo sull’infrastruttura sono requisiti stringenti — come ambienti bancari, sanitari o della pubblica amministrazione. Ollama, una piattaforma che consente di eseguire LLM localmente, offre una soluzione interessante per affrontare queste sfide. In questo articolo, esploreremo come implementare Ollama su OpenShift, una piattaforma di containerizzazione basata su Kubernetes, per sfruttare i vantaggi dei LLM in un ambiente sicuro e controllato, insieme a OpenWeb UI, per una gestione semplificata dei modelli.

Leggi
Immagine di copertina
Churn Prediction in Python: come usare NLTK per l'analisi del sentiment dei clienti

La churn prediction è la tecnica di machine learning che permette di identificare i clienti a rischio di abbandono prima che lascino effettivamente un servizio. In questo articolo costruiremo un modello di churn prediction in Python, integrando l’analisi del sentiment con NLTK per estrarre segnali dal feedback testuale dei clienti — una delle fonti di dati più ricche e spesso sottoutilizzate nelle strategie di retention.

Leggi
Immagine di copertina
Quantizzazione dei modelli LLM con Ollama: guida a Q4_K_M, Q8 e formato GGUF

La quantizzazione è la tecnica che permette di ridurre le dimensioni di un modello LLM comprimendo i pesi numerici da 16 o 32 bit a rappresentazioni più compatte come 8 o 4 bit. Con Ollama, puoi scegliere il livello di quantizzazione più adatto alle risorse della tua macchina attraverso il formato GGUF. In questa guida esploriamo come funziona, quali sono le differenze tra Q4_K_M, Q8 e Q16, e come bilanciare qualità e consumo di memoria.

Leggi
Immagine di copertina
Ollama Memory Scheduling: come funziona la gestione della memoria per LLM locali

Ollama gestisce il ciclo di vita dei modelli LLM in locale con un meccanismo di memory scheduling che decide autonomamente quando caricare un modello in VRAM, quanto mantenerlo attivo e quando rilasciare la memoria. Capire questo meccanismo è fondamentale per ottimizzare le performance dei modelli che esegui sulla tua macchina ed evitare latenze inattese al primo prompt.

Leggi

Prossimi eventi

Immagine di copertina

Come To Code 2026

26-27 settembre 2026

Pignola, Basilicata

Tutti gli eventi ➡

Partners

Community, aziende e persone che supportano attivamente il blog

Vuoi diventare partner?

Collaboriamo con community, aziende e strumenti del mondo tech che vogliono raggiungere la nostra community di dev ed engineer italiani. Scrivici per proporre una collaborazione.

Vuoi diventare tech content creator? 🖊️

Se ti va di raccontare la tua esperienza nel mondo tech, questo è il posto giusto.

Cerchiamo voci autentiche, esempi pratici e punti di vista utili per chi legge.

Scrivici a collaborazioni[at]theredcode.it con una proposta: idea, taglio del contenuto e una breve presentazione. Non vediamo l'ora di leggere la tua esperienza!

Invia la tua idea