Distiller Cloud
Vai al contenuto principale
Beta privata — apertura a breve

Il modello è tuo.
Non un abbonamento a quello di qualcun altro.

Distiller Cloud trasforma un grande modello teacher open in un LLM piccolo e specializzato: addestrato su un dataset sintetico costruito sul tuo compito, consegnato come file da scaricare. Lo esegui sul tuo Mac, sulla tua RTX o sui tuoi server. Senza competenze di machine learning.

Una sola email al lancio. Niente newsletter, nessuna condivisione con terzi. Disiscrizione con un clic.

  • I pesi sono tuoi: li scarichi e restano tuoi
  • Dati e modello distrutti entro 48 ore
  • Gira in locale, nessun costo a token

Il problema

L'inferenza cloud è un affitto che non smetti mai di pagare.

Ogni richiesta esce dalla tua infrastruttura, viene fatturata a token e gira su un modello molto più grande di quanto il tuo compito richieda. Ottimizzi i prompt per un sistema che non controlli, non puoi ispezionare e non puoi portarti via.

Un costo che non finisce

La spesa cresce con l'uso, non con il valore. Il successo la peggiora, e il prezzo lo decide qualcun altro.

I tuoi dati escono di casa

Ogni prompt è una divulgazione. Le clausole di retention cambiano, i subfornitori cambiano, e il tuo ufficio compliance se ne accorge.

Sovradimensionato per il compito

Un generalista da mille miliardi di parametri per classificare ticket di assistenza. Paghi capacità che non userai mai.

Come funziona

Dalla descrizione del compito ai pesi sul tuo disco.

Quattro passaggi in un'interfaccia guidata. Niente notebook, niente CUDA, nessun training da sorvegliare.

  1. 01

    Configura

    Descrivi il compito e scegli un modello teacher open. L'interfaccia ti accompagna su ambito, tono e formato di output: nessun iperparametro da indovinare.

  2. 02

    Distilla

    Generiamo il dataset sintetico, lo dividiamo in training e validation set ed eseguiamo la distillazione. Tu guardi le curve di loss, all'infrastruttura pensiamo noi.

  3. 03

    Scarica

    Ricevi i pesi in formati standard — GGUF, safetensors — con il report di valutazione. Girano su Apple Silicon, NVIDIA RTX, DGX Spark o sui tuoi server.

  4. 04

    Il resto viene distrutto

    Entro 48 ore dataset, esecuzione e modello vengono cancellati dalla nostra infrastruttura. Non archiviati. Non anonimizzati. Eliminati.

Cosa ottieni

Piccolo, specializzato e davvero tuo.

I pesi sono tuoi

Il modello è un file. Lo scarichi, lo copi, lo distribuisci e lo tieni anche se smetti di essere nostro cliente. Nessuna API key nel percorso critico, nessun lock-in, nessun costo a token.

Zero retention per progetto

Dati e modello vengono distrutti entro 48 ore, automaticamente e non su richiesta. Sui nostri server non resta nulla perché conservarlo non fa parte del prodotto.

Inferenza locale, bassa latenza

Un modello dimensionato su un compito gira sull'hardware che hai già, risponde in millisecondi senza round trip e consuma una frazione dell'energia di una chiamata a un'API frontier.

Nessuna competenza ML richiesta

Generazione del dataset, split train/validation, valutazione: gestiti. Se sai descrivere il compito a parole, sai produrre un modello funzionante.

Modelli teacher open

Distilli da modelli open-weight maturi. Sai esattamente da cosa ha imparato il tuo student, e la licenza viaggia con te.

Valutazioni leggibili

Ogni esecuzione arriva con metriche di validazione ed esempi di errore, così decidi se il modello è abbastanza buono prima che si avvicini alla produzione.

Perché adesso

I pezzi sono arrivati solo ora, e tutti e quattro insieme.

L'hardware locale capace è ovunque

Apple Silicon, schede RTX e DGX Spark hanno messo inferenza seria su scrivanie che tre anni fa non ne avevano. Il runtime è già pagato.

I modelli open sono maturati

I teacher open-weight sono finalmente abbastanza forti da cui distillare, con licenze che lo permettono. Due anni fa il divario di qualità rendeva tutto questo inutile.

I conti dell'energia sono cambiati

Il costo ricorrente dell'AI è l'inferenza, non l'addestramento. Un modello della taglia del compito trasforma una spesa a consumo in una spesa fissa.

La normativa spinge on-premise

GDPR ed EU AI Act rendono località del dato e tracciabilità una questione da consiglio di amministrazione. Un modello che gira dentro il tuo perimetro è la risposta più breve.

Zero retention

Cancelliamo tutto entro 48 ore.

Promettere privacy e tenersi comunque i dati è facile. Per questo abbiamo progettato il servizio attorno al non averli: dataset, artefatti di addestramento e modello vengono rimossi dalla nostra infrastruttura entro 48 ore dalla fine dell'esecuzione. Non c'è archivio da esibire in tribunale né backup da far trapelare, perché la conservazione non è mai stata parte del prodotto.

  1. 0h

    L'esecuzione parte

    La descrizione del compito e il dataset generato esistono solo per la durata del job.

  2. ~2h

    Modello pronto

    Scarichi i pesi e il report di valutazione. Da qui in poi il modello è interamente tuo.

  3. 48h

    Cancellazione totale

    Dataset, checkpoint e modello finale vengono eliminati automaticamente. Non c'è nulla da disattivare.

  • Nessun addestramento sui tuoi dati, per nessuno scopo
  • Nessuna condivisione con terzi, data broker o ad tech
  • La cancellazione è automatica, non una richiesta al supporto
  • Infrastruttura europea, conforme al GDPR per costruzione

L'unica cosa che conserviamo è la tua email, perché ci hai chiesto tu di avvisarti al lancio.

Accesso anticipato

Ci sei quando apriamo.

Facciamo entrare la prima coorte a piccoli gruppi, per riuscire davvero a parlare con ogni team. Iscriviti ora ed entri per primo, con crediti di distillazione gratuiti per la beta e una linea diretta con chi sta costruendo il prodotto.

  • Accesso prioritario all'apertura della beta
  • Crediti gratuiti per le prime distillazioni
  • Voce in capitolo su quali teacher e formati arrivano prima

Nessun conto alla rovescia, nessun contatore di posti fasullo. Apriamo quando il prodotto è abbastanza buono, e tu sarai tra i primi a saperlo.

Una sola email al lancio. Niente newsletter, nessuna condivisione con terzi. Disiscrizione con un clic.

Domande

Prima di iscriverti.

Dopo le 48 ore il modello resta davvero mio?

Sì. La finestra di 48 ore riguarda i nostri server, non il tuo download. Una volta scaricati i pesi, il file è tuo per sempre: continua a funzionare se smetti di essere cliente e continua a funzionare se noi sparissimo.

Quanto è buono davvero un modello piccolo distillato?

Su un compito ben definito un modello piccolo distillato bene si avvicina al suo teacher, e batte un modello grande generico che non sa nulla del tuo dominio. Sul ragionamento generale aperto no, e te lo diciamo quando la distillazione è lo strumento sbagliato per il tuo problema.

Che hardware serve per eseguirlo?

Un Mac recente con Apple Silicon, una scheda NVIDIA RTX, un DGX Spark o un server modesto bastano per le taglie di modello a cui puntiamo. Consegniamo formati standard — GGUF e safetensors — quindi i runtime locali più diffusi funzionano subito.

Quanto costa?

Il prezzo non è definito, ed è esattamente per questo che lo chiediamo ai primi iscritti. Il modello di prezzo è per distillazione, non per token: paghi per produrre il modello, poi l'inferenza è gratis perché gira sul tuo hardware.

I miei dati restano privati durante l'addestramento?

Dataset, artefatti temporanei e modello risultante vengono eliminati dalla nostra infrastruttura entro 48 ore dalla conclusione del lavoro. Non usiamo dati dei clienti per addestrare i nostri modelli né li condividiamo con terzi.

Devo conoscere il machine learning o saper programmare?

Non serve competenza ML per creare il modello. Devi saper descrivere il compito e valutare esempi del tuo dominio; il flusso guidato gestisce i passaggi tecnici e consegna formati standard.

In cosa è diverso dall'usare direttamente un'API LLM?

Con un'API affitti un modello generalista e paghi ogni utilizzo. Distiller Cloud produce un modello più piccolo per un compito definito, che scarichi ed esegui sull'hardware sotto il tuo controllo senza una tariffa ricorrente per token.

Aspetto