Vai al contenuto
SalvitelleCorporate Hub

CorporateAI

Visione di progetto

Infrastruttura AIcome utilitycondivisa.

Un'infrastruttura di calcolo locale, proposta per l'ecosistema Salvitelle: le aziende residenti attingono a capacità condivisa invece di costruirsi ognuna il proprio stack.

  1. 05Spazi di lavoro
  2. 04Piattaforma AI
  3. 03Archiviazione e rete
  4. 02Calcolo
  5. 01Energia
Diagramma astratto di un edificio su cinque livelli sovrapposti — energia, calcolo, archiviazione e rete, piattaforma AI, spazi di lavoro — attraversati da un flusso di dati che sale dal basso verso l'alto.

Il problema

L'AI costa cara quando ognuno se la costruisce da solo.

Ogni azienda che lavora con l'AI affronta lo stesso conto: acceleratori, archiviazione, rete, modelli. Moltiplicato per tre aziende diventa tre volte la stessa spesa, per una capacità che quasi sempre resta in gran parte inutilizzata.

Tre aziende, tre stack

Una sola infrastruttura, molte aziende

  • Acceleratori
  • Archiviazione
  • Rete
  • Modelli

Nel modello proposto la capacità sta in un punto solo e le aziende ne attingono secondo il proprio carico di lavoro. È la stessa logica che il progetto applica già a uffici, energia e servizi.

Seleziona un'azienda per vedere il suo carico di lavoro.

Direzioni dichiarate

Obiettivo

Nessun documento di progetto descrive oggi capacità di calcolo AI. Quelle che seguono sono direzioni dichiarate, non servizi disponibili.

  • Calcolo AI condiviso
  • Modelli open-weight
  • Inferenza
  • Fine-tuning
  • RAG e ricerca sui documenti
  • Prototipazione rapida

Hardware di riferimento

Che cosa può fare un nodo.

Per ragionare su numeri concreti serve una piattaforma di riferimento. Le cifre qui sotto descrivono un nodo di calcolo disponibile sul mercato: servono a dare un ordine di grandezza, non descrivono hardware di Salvitelle.

Specifica di riferimento. La configurazione finale di CorporateAI è da definire.

  • Valore teorico FP4, ottenuto sfruttando la sparsity.

Prestazioni misurate

Due misurazioni pubblicate sulla stessa piattaforma. Usano precisioni e backend diversi: sono due punti indipendenti, non una gara fra modelli.

Elaborazione del prompt

  • Qwen3 14B5928,95token/s

    NVFP4 · TRT-LLM

  • GPT-OSS-20B3670,42token/s

    MXFP4 · llama.cpp

Generazione dei token

  • Qwen3 14B22,71token/s

    NVFP4 · TRT-LLM

  • GPT-OSS-20B82,74token/s

    MXFP4 · llama.cpp

Condizioni: ISL|OSL = 2048|128 · BS=1
I risultati variano con modello, backend, precisione e carico di lavoro.

E con più nodi?

La capacità aggregata è una moltiplicazione — ed è proprio questo a renderla teorica.

PFLOP FP4 aggregati
1
GB di memoria aggregata
128

Capacità aggregata teorica. Le prestazioni reali dipendono da carico di lavoro, rete, software, utilizzo e modello, e non crescono in modo lineare.

Dai modelli piccoli alla scala di frontiera.

Quanto spazio occupa un modello, e a che cosa serve una taglia rispetto a un'altra.

7B

Sperimentazione locale

Peso dei parametri a 4 bit

4GB

sui 128 GB di memoria unificata di un nodo

Visualizzazione didattica. Il valore indica i soli pesi: la memoria realmente occupata aggiunge cache KV, attivazioni e runtime. Non implica che ogni modello di ogni taglia giri in modo efficiente sulla piattaforma di riferimento.

Quante macchine servono davvero

Sposta i cursori. Il modello è aritmetica su due ipotesi dichiarate, e non produce euro: nessun documento di progetto indica un prezzo per nodo, quindi una cifra in denaro qui sarebbe inventata. Produce macchine — quante ne servono da soli, quante condividendo, e quante non serve comprare.

5

110

Leggero

4 GB di pesi residenti per azienda

Scenario

Risultato dello scenario

Nodi, ognuno per sé
5

3% della memoria usata

Nodi, condividendo
1

16% della memoria usata

Nodi non acquistati
4

Macchine, non risparmio: il prezzo di un nodo non è dichiarato da nessuna fonte.

5 aziende tengono in memoria 20 GB di pesi in tutto. Un nodo di riferimento ne ha 128.

Ipotesi

  • A · Un nodo è l'unità che si compra. Un'azienda che si attrezza da sola compra almeno un nodo, anche se non riesce a riempirlo. È questa indivisibilità l'argomento della pagina: non che l'hardware condiviso costi meno, ma che l'unità minima acquistabile è più grande di quello che serve alla maggior parte delle aziende.
  • B · Il carico di lavoro è espresso come pesi del modello residenti in memoria, nelle taglie a 4 bit che questa pagina pubblica poco sopra. La memoria è il vincolo che si può ragionare senza inventare una cifra di throughput.

Solo i pesi: cache KV, attivazioni e runtime stanno sopra questi numeri, quindi sono un pavimento e non un requisito. Condividere memoria non è condividere tempo: questo dice che i modelli del gruppo ci stanno, non che girino tutti insieme a piena velocità. Il nodo è la piattaforma di riferimento descritta sopra, non una configurazione CorporateAI progettata: tutte le capacità lato Salvitelle restano da determinare.

Lato Salvitelle

Quello che non è ancora deciso.

I numeri qui sopra descrivono una piattaforma di riferimento. Questi invece riguardano CorporateAI, e nessuno di essi è determinato: dimensionamento, capacità e modello economico dipendono dallo studio di fattibilità.

Numero di acceleratori

n.

Da determinare

Capacità di calcolo aggregata

Da determinare

Dimensione del cluster

Da determinare

Potenza elettrica dedicata

kW

Da determinare

Modello economico

Da determinare
Da determinare
Non ancora determinato: sarà definito dal modello economico.

Una infrastruttura.Molte imprese.

CorporateAI è pensata come uno strato di infrastruttura AI condivisa dentro Salvitelle Corporate Hub. Non un altro prodotto SaaS: un'infrastruttura fisica e digitale pensata perché le aziende costruiscano.

Allocazione

Da determinare

Il modello prevede che le startup residenti selezionate possano accedere a una quota definita dell'infrastruttura senza addebiti diretti di infrastruttura, subordinatamente al modello operativo finale e alla capacità disponibile.

Entità dell'allocazione e modello operativo non sono determinati.

Da dove si comincia