✍️ Blog

Kompaktes Sprachmodell mit Bildverarbeitung: North Micro Vision

23. August 2026·Quelle: Hugging Face Blog

Hugging Face und Cohere haben ein neues Vision-Language-Modell mit 2,4 Milliarden Parametern vorgestellt. North Micro Vision kann Bilder in ihrer natürlichen Auflösung verarbeiten – ideal für Anwendungen wie Dokumentenerkennung oder Tabellenlesen. Das Modell steht unter offener Apache-Lizenz zur Verfügung und soll auf Laptops und Edge-Geräten laufen können.

Unsere Einordnung

Die Veröffentlichung zeigt einen wichtigen Trend: Während Giganten wie OpenAI und Google immer größere Multimodal-Modelle trainieren, entstehen spezialisierte, schlanke Alternativen für lokale Verarbeitung. North Micro Vision adressiert einen echten Markt für Dokumentenverarbeitung und datenschutzfreundliche Bildanalyse – ob das Modell in der Praxis gegen etablierte Konkurrenten bestehen kann, muss sich zeigen.

Schlüsselfakten

  • 2,4 Milliarden Parameter – eines der kleinsten Open-Weight Vision-Language-Modelle
  • Native-Resolution-Bildverarbeitung erhält Bilddetails und Aspektverhältnisse vollständig
  • Multilingual: Unterstützt visuelle Inhalte in mehreren Sprachen
  • Apache-2.0-Lizenz mit offenen Gewichten
  • Läuft auf Edge-Geräten, Laptops und mobiler Hardware mit passender Quantisierung

Artikel teilen