
MODULO · Inference locale di modelli LLM

In pochi click porti l'inference dei modelli LLM dentro il tuo perimetro: on-premise, cloud privato o air-gapped. Zero egress, zero dipendenza da API esterne: ogni modulo ARI si appoggia ad ARIrun dal primo minuto.
Scala per:
Classe e numero di istanze GPU *
·
da 270 €/mese
Come funziona
01
Scegli il modello dal catalogo e attivalo
Selezioni il modello dalla libreria Hugging Face supportata. Un click e ARIrun lo mette in funzione sul tuo hardware.
02
Tutta la suite, con massima privacy
ARIchat, ARIknow, ARIdb, ARIdoc e ARIflow si agganciano ad ARIrun senza integrazioni da scrivere. L'architettura resta la stessa: cambi solo dove gira l'inference.
03
Zero dati fuori dal perimetro
Da qui in poi ogni chiamata AI della suite passa dentro il tuo perimetro. Monitoraggio incluso, zero traffico verso server esterni.
Tutta la suite
Nessuna integrazione separata da mantenere: ogni modulo si collega da solo, e nessun dato in più esce dal tuo perimetro.
ARIknow
Embedding e retrieval calcolati in locale, RAG che non lascia mai il perimetro.
ARIdb
NL→SQL generato da modelli che girano sulla tua infrastruttura.
ARIdoc
Estrazione e OCR semantico elaborati internamente, documenti mai inviati fuori.
ARIflow
Ogni nodo LLM dei workflow punta ad ARIrun, orchestrazione end-to-end privata.
ARIchat
Chat multi-utente su modelli locali, inclusa gratis, zero setup aggiuntivo.
Incluso gratuitamente
ARIchat è la UI chat multi-utente di ARI: inclusa a zero costo con qualsiasi acquisto di ARIrun. Sessioni persistenti, user management, routing verso i modelli configurati sul tuo runtime. Tutto gira localmente: nessun token esce dalla tua infrastruttura.
Funzionalità con ARIflow
Quando costruisci workflow con ARIflow, ogni nodo che chiama un LLM può puntare ad ARIrun. L'orchestrazione, i test automatici e il deploy avvengono senza che un solo token esca dalla tua infrastruttura.
Inference locale nei workflow
Ogni step di ARIflow che invoca un modello usa ARIrun come backend. Nessuna chiamata API esterna nei workflow di produzione.
Switch modello senza downtime
Aggiorna il modello usato da un workflow con un click. ARIrun gestisce il rollout graduale: il vecchio modello risponde finché il nuovo è pronto.
Test su modelli multipli
Il sistema di testing di ARIflow può confrontare lo stesso workflow su modelli diversi in parallelo. Scegli il modello migliore per ogni task con dati reali.
Monitoring unificato
Le metriche di ARIrun (latenza, throughput) sono visibili direttamente nella dashboard di ARIflow. Un'unica vista su performance del workflow e del layer di inference.
I moduli sono acquistabili singolarmente. ARIflow è opzionale e amplia le funzionalità di ciascun modulo.
Pricing
Prezzi per istanza GPU on-premise: software ARIrun sul tuo hardware. Disponibile anche in modalità SaaS su cloud BlackBytes (hardware incluso), con pricing su richiesta. ARIchat è inclusa gratuitamente con ARIrun.
✓ ARIchat inclusa gratuitamente
✓ Disponibile anche SaaS (su richiesta)
✓ Fatturazione mensile o annuale
Classe S
270 €
/istanza / mese
24 GB VRAM · Gemma 4 26B, Mistral Small 24B, Qwen3-35B
✓
Modelli ~26–35B parametri (Q4)
✓
~3–5 req/min throughput single-user
✓
Ideale per chat privacy-first e QA su KB
✓
ARIchat inclusa gratuitamente
✓
Endpoint OpenAI-compatibile
✓
Monitoring e audit trail inclusi
Classe M
530 €
/istanza / mese
48 GB VRAM · Llama 3.3 70B, Qwen3-72B, Mistral Small 4 119B
✓
Modelli ~70–120B parametri (Q4)
✓
~100 utenti attivi concorrenti
✓
Qualità paragonabile a GPT-4o-mini
✓
Routing multi-modello configurabile
✓
Autoscaling e load balancing
✓
Supporto modelli fine-tuned custom
Classe L
1.100 €
/istanza / mese
80 GB VRAM · Llama 4, Qwen3-72B FP8, DeepSeek V4
✓
Modelli frontier-adjacent (FP8 / MoE)
✓
~250+ utenti concorrenti
✓
Qualità paragonabile a Claude Haiku / Gemini Flash
✓
Ambienti air-gapped certificati
✓
SLA premium disponibili
Classe XL
2.700 €
/istanza / mese
180+ GB VRAM · deploy cluster multi-nodo
✓
Modelli frontier su cluster dedicato
✓
Deploy multi-nodo e scaling orizzontale
✓
Massimo throughput e concorrenza
✓
Ambienti air-gapped certificati
✓
SLA premium disponibili
* I prezzi riportati sono per singola istanza on-premise (software ARIrun sulla tua GPU) e scalano per classe (S / M / L / XL) e per numero di istanze attive. Il tier si calcola sul picco di istanze attive nel periodo di fatturazione. Sconto bundle multi-GPU: -10% dalla 2ª istanza, -15% dalla 4ª istanza in poi (stessa classe). Disponibile anche in modalità SaaS (cloud BlackBytes, hardware incluso): pricing su richiesta.
Deployment
On-Premise
Installato sui tuoi server. Dati mai fuori dal tuo perimetro.
Air-Gapped
Completamente isolato dalla rete. Per ambienti ad alta sicurezza.
Upon request
SaaS
Ospitato da noi. Zero infrastruttura da gestire.
Dettagli su privacy, compliance e architettura → Deploy & Privacy
Sconto bundle
Ogni modulo aggiuntivo oltre il primo ti dà il 5% di sconto sul totale: fino al 15% con quattro moduli. Se aggiungi ARIflow, scatta un ulteriore 10%.
Lo sconto massimo è del 25%: quattro moduli più ARIflow.
Esempio: ARIdb + ARIknow + ARIflow → sconto del 15%. 23.400 €/anno diventano 19.890 €.
ARIchat è inclusa gratuitamente, non conta nel bundle.
1 modulo
0%
2 moduli
5%
3 moduli
10%
4 moduli
15%
+ ARIflow
+10%
ARIchat, ARIknow, ARIdb e ARIdoc si provano gratuitamente: stessa suite, stessa privacy.
Hai ancora dei dubbi?
Prenota una consulenza veloceCookie e tracciamento
Utilizziamo cookie tecnici e — previo tuo consenso — cookie analitici e di marketing per misurare il traffico del sito e migliorare l'esperienza. Puoi accettare, rifiutare o modificare la tua scelta in qualsiasi momento.
Maggiori informazioni nella Cookies Policy →