Hugging Face und Cohere haben ein neues Vision-Language-Modell mit 2,4 Milliarden Parametern vorgestellt. North Micro Vision kann Bilder in ihrer natürlichen Auflösung verarbeiten – ideal für Anwendungen wie Dokumentenerkennung oder Tabellenlesen. Das Modell steht unter offener Apache-Lizenz zur Verfügung und soll auf Laptops und Edge-Geräten laufen können.
Kompaktes Sprachmodell mit Bildverarbeitung: North Micro Vision
Unsere Einordnung
Die Veröffentlichung zeigt einen wichtigen Trend: Während Giganten wie OpenAI und Google immer größere Multimodal-Modelle trainieren, entstehen spezialisierte, schlanke Alternativen für lokale Verarbeitung. North Micro Vision adressiert einen echten Markt für Dokumentenverarbeitung und datenschutzfreundliche Bildanalyse – ob das Modell in der Praxis gegen etablierte Konkurrenten bestehen kann, muss sich zeigen.
Schlüsselfakten
- 2,4 Milliarden Parameter – eines der kleinsten Open-Weight Vision-Language-Modelle
- Native-Resolution-Bildverarbeitung erhält Bilddetails und Aspektverhältnisse vollständig
- Multilingual: Unterstützt visuelle Inhalte in mehreren Sprachen
- Apache-2.0-Lizenz mit offenen Gewichten
- Läuft auf Edge-Geräten, Laptops und mobiler Hardware mit passender Quantisierung