La quantizzazione è la tecnica che permette di ridurre le dimensioni di un modello LLM comprimendo i pesi numerici da 16 o 32 bit a rappresentazioni più compatte come 8 o 4 bit. Con Ollama, puoi scegliere il livello di quantizzazione più adatto alle risorse della tua macchina attraverso il formato GGUF. In questa guida esploriamo come funziona, quali sono le differenze tra Q4_K_M, Q8 e Q16, e come bilanciare qualità e consumo di memoria.
Leggi
















