Un costo che non finisce
La spesa cresce con l'uso, non con il valore. Il successo la peggiora, e il prezzo lo decide qualcun altro.
Distiller Cloud trasforma un grande modello teacher open in un LLM piccolo e specializzato: addestrato su un dataset sintetico costruito sul tuo compito, consegnato come file da scaricare. Lo esegui sul tuo Mac, sulla tua RTX o sui tuoi server. Senza competenze di machine learning.
Il problema
Ogni richiesta esce dalla tua infrastruttura, viene fatturata a token e gira su un modello molto più grande di quanto il tuo compito richieda. Ottimizzi i prompt per un sistema che non controlli, non puoi ispezionare e non puoi portarti via.
La spesa cresce con l'uso, non con il valore. Il successo la peggiora, e il prezzo lo decide qualcun altro.
Ogni prompt è una divulgazione. Le clausole di retention cambiano, i subfornitori cambiano, e il tuo ufficio compliance se ne accorge.
Un generalista da mille miliardi di parametri per classificare ticket di assistenza. Paghi capacità che non userai mai.
Come funziona
Quattro passaggi in un'interfaccia guidata. Niente notebook, niente CUDA, nessun training da sorvegliare.
Descrivi il compito e scegli un modello teacher open. L'interfaccia ti accompagna su ambito, tono e formato di output: nessun iperparametro da indovinare.
Generiamo il dataset sintetico, lo dividiamo in training e validation set ed eseguiamo la distillazione. Tu guardi le curve di loss, all'infrastruttura pensiamo noi.
Ricevi i pesi in formati standard — GGUF, safetensors — con il report di valutazione. Girano su Apple Silicon, NVIDIA RTX, DGX Spark o sui tuoi server.
Entro 48 ore dataset, esecuzione e modello vengono cancellati dalla nostra infrastruttura. Non archiviati. Non anonimizzati. Eliminati.
Cosa ottieni
Il modello è un file. Lo scarichi, lo copi, lo distribuisci e lo tieni anche se smetti di essere nostro cliente. Nessuna API key nel percorso critico, nessun lock-in, nessun costo a token.
Dati e modello vengono distrutti entro 48 ore, automaticamente e non su richiesta. Sui nostri server non resta nulla perché conservarlo non fa parte del prodotto.
Un modello dimensionato su un compito gira sull'hardware che hai già, risponde in millisecondi senza round trip e consuma una frazione dell'energia di una chiamata a un'API frontier.
Generazione del dataset, split train/validation, valutazione: gestiti. Se sai descrivere il compito a parole, sai produrre un modello funzionante.
Distilli da modelli open-weight maturi. Sai esattamente da cosa ha imparato il tuo student, e la licenza viaggia con te.
Ogni esecuzione arriva con metriche di validazione ed esempi di errore, così decidi se il modello è abbastanza buono prima che si avvicini alla produzione.
Perché adesso
Apple Silicon, schede RTX e DGX Spark hanno messo inferenza seria su scrivanie che tre anni fa non ne avevano. Il runtime è già pagato.
I teacher open-weight sono finalmente abbastanza forti da cui distillare, con licenze che lo permettono. Due anni fa il divario di qualità rendeva tutto questo inutile.
Il costo ricorrente dell'AI è l'inferenza, non l'addestramento. Un modello della taglia del compito trasforma una spesa a consumo in una spesa fissa.
GDPR ed EU AI Act rendono località del dato e tracciabilità una questione da consiglio di amministrazione. Un modello che gira dentro il tuo perimetro è la risposta più breve.
Zero retention
Promettere privacy e tenersi comunque i dati è facile. Per questo abbiamo progettato il servizio attorno al non averli: dataset, artefatti di addestramento e modello vengono rimossi dalla nostra infrastruttura entro 48 ore dalla fine dell'esecuzione. Non c'è archivio da esibire in tribunale né backup da far trapelare, perché la conservazione non è mai stata parte del prodotto.
La descrizione del compito e il dataset generato esistono solo per la durata del job.
Scarichi i pesi e il report di valutazione. Da qui in poi il modello è interamente tuo.
Dataset, checkpoint e modello finale vengono eliminati automaticamente. Non c'è nulla da disattivare.
L'unica cosa che conserviamo è la tua email, perché ci hai chiesto tu di avvisarti al lancio.
Accesso anticipato
Facciamo entrare la prima coorte a piccoli gruppi, per riuscire davvero a parlare con ogni team. Iscriviti ora ed entri per primo, con crediti di distillazione gratuiti per la beta e una linea diretta con chi sta costruendo il prodotto.
Nessun conto alla rovescia, nessun contatore di posti fasullo. Apriamo quando il prodotto è abbastanza buono, e tu sarai tra i primi a saperlo.
Domande
Sì. La finestra di 48 ore riguarda i nostri server, non il tuo download. Una volta scaricati i pesi, il file è tuo per sempre: continua a funzionare se smetti di essere cliente e continua a funzionare se noi sparissimo.
Su un compito ben definito un modello piccolo distillato bene si avvicina al suo teacher, e batte un modello grande generico che non sa nulla del tuo dominio. Sul ragionamento generale aperto no, e te lo diciamo quando la distillazione è lo strumento sbagliato per il tuo problema.
Un Mac recente con Apple Silicon, una scheda NVIDIA RTX, un DGX Spark o un server modesto bastano per le taglie di modello a cui puntiamo. Consegniamo formati standard — GGUF e safetensors — quindi i runtime locali più diffusi funzionano subito.
Il prezzo non è definito, ed è esattamente per questo che lo chiediamo ai primi iscritti. Il modello di prezzo è per distillazione, non per token: paghi per produrre il modello, poi l'inferenza è gratis perché gira sul tuo hardware.
Dataset, artefatti temporanei e modello risultante vengono eliminati dalla nostra infrastruttura entro 48 ore dalla conclusione del lavoro. Non usiamo dati dei clienti per addestrare i nostri modelli né li condividiamo con terzi.
Non serve competenza ML per creare il modello. Devi saper descrivere il compito e valutare esempi del tuo dominio; il flusso guidato gestisce i passaggi tecnici e consegna formati standard.
Con un'API affitti un modello generalista e paghi ogni utilizzo. Distiller Cloud produce un modello più piccolo per un compito definito, che scarichi ed esegui sull'hardware sotto il tuo controllo senza una tariffa ricorrente per token.
Aspetto