✍️ Blog

NVIDIA Nemotron 3.5 Lightning: Kompaktes KI-Modell für lokale Agenten

24. August 2026·Quelle: Ollama Blog

NVIDIAs neues Sprachmodell Nemotron 3.5 Lightning ist ab sofort über Ollama verfügbar und läuft vollständig auf lokalen Geräten. Das 30-Milliarden-Parameter-Modell mit nur 3 Milliarden aktiven Parametern pro Token wurde speziell für autonome Agenten entwickelt, die längerfristig Aufgaben bewältigen: Dateien lesen, Tools aufrufen und mehrstufige Prozesse durcharbeiten. Mit einer Kontextlänge von 1 Million Token und optimierter Inferenz-Geschwindigkeit (bis zu 4x schneller als vergleichbare offene Modelle) eignet sich Nemotron 3.5 Lightning besonders für Szenarien, in denen Daten nicht die Cloud verlassen dürfen – etwa persönliche Assistenten, Code-Analyse oder IT-Sicherheit. Das offene Modell kann auf eigenen Datensätzen nachtrainiert werden und funktioniert auf NVIDIA RTX PCs, Workstations und in Rechenzentren gleichermaßen.

Unsere Einordnung

Nemotron 3.5 Lightning adressiert einen wachsenden Trend: Während große Sprachmodelle für Rechenzentren optimiert sind, brauchen lokale KI-Agenten kompaktere, spezialisierte Architekturen. NVIDIAs Mixture-of-Experts-Ansatz könnte zum Standard für Edge-basierte Agentenarbeit werden – ein Gegenpol zur Cloud-Abhängigkeit von ChatGPT und Co.

Schlüsselfakten

  • 30 Milliarden Parameter mit nur 3 Milliarden aktiven pro Token – speziell für lokale Systeme optimiert
  • 1 Million Token Kontextlänge für lange Aufgabenhistorien und mehrstufige Workflows
  • Bis zu 4x höherer Durchsatz durch speculative decoding und Multi-Token-Prediction
  • Offenes Gewicht und open-source Trainingsdaten – vollständig lokal anpassbar
  • Sofort über Ollama verfügbar auf NVIDIA RTX, DGX und Cloud-Infrastruktur

Artikel teilen