NVIDIAs neues Sprachmodell Nemotron 3.5 Lightning ist ab sofort über Ollama verfügbar und läuft vollständig auf lokalen Geräten. Das 30-Milliarden-Parameter-Modell mit nur 3 Milliarden aktiven Parametern pro Token wurde speziell für autonome Agenten entwickelt, die längerfristig Aufgaben bewältigen: Dateien lesen, Tools aufrufen und mehrstufige Prozesse durcharbeiten. Mit einer Kontextlänge von 1 Million Token und optimierter Inferenz-Geschwindigkeit (bis zu 4x schneller als vergleichbare offene Modelle) eignet sich Nemotron 3.5 Lightning besonders für Szenarien, in denen Daten nicht die Cloud verlassen dürfen – etwa persönliche Assistenten, Code-Analyse oder IT-Sicherheit. Das offene Modell kann auf eigenen Datensätzen nachtrainiert werden und funktioniert auf NVIDIA RTX PCs, Workstations und in Rechenzentren gleichermaßen.
NVIDIA Nemotron 3.5 Lightning: Kompaktes KI-Modell für lokale Agenten
Unsere Einordnung
Nemotron 3.5 Lightning adressiert einen wachsenden Trend: Während große Sprachmodelle für Rechenzentren optimiert sind, brauchen lokale KI-Agenten kompaktere, spezialisierte Architekturen. NVIDIAs Mixture-of-Experts-Ansatz könnte zum Standard für Edge-basierte Agentenarbeit werden – ein Gegenpol zur Cloud-Abhängigkeit von ChatGPT und Co.
Schlüsselfakten
- 30 Milliarden Parameter mit nur 3 Milliarden aktiven pro Token – speziell für lokale Systeme optimiert
- 1 Million Token Kontextlänge für lange Aufgabenhistorien und mehrstufige Workflows
- Bis zu 4x höherer Durchsatz durch speculative decoding und Multi-Token-Prediction
- Offenes Gewicht und open-source Trainingsdaten – vollständig lokal anpassbar
- Sofort über Ollama verfügbar auf NVIDIA RTX, DGX und Cloud-Infrastruktur