KI

Mac Studio als lokale KI-Werkstatt: meine ersten Erfahrungen

· wp-admin

Bemooste Äste in einem Wald, Sinnbild für den LLM-Wald

Lokale KI ist praxistauglich, und zwar schneller, als ich erwartet hatte. Seit gut einer Woche steht ein Mac Studio auf meinem Schreibtisch. Dieser Beitrag fasst zusammen, was ich in dieser Zeit mit lokalen Sprachmodellen erlebt habe.

Was auf dem Schreibtisch steht

Die Hardware ist unspektakulär, und genau das ist der Punkt: ein Mac Studio mit M5 Max, 128 GB Arbeitsspeicher und 1 TB SSD. Kein Server, kein Rack, kein Lüfterlärm. Das Gerät passt auf jeden Schreibtisch und läuft an einer normalen Steckdose.

Darauf laufen zwei Werkzeuge:

  • oMLX als Laufzeitumgebung für die Sprachmodelle. Es nutzt Apples MLX-Framework und damit den gemeinsamen Speicher von CPU und GPU, der auf Apple Silicon besonders viel Platz für große Modelle bietet.
  • Obsidian als Wissenssystem. Dort liegen meine Prüfchecklisten, Fachwissen und Notizen, die ich den Modellen als Kontext mitgebe.

Als Modelle hatte ich zunächst Qwen3.5-35B-A3B von Alibaba und Nemotron-3-Super-120B-A12B von NVIDIA mit einer Quantisierung von 4 Bit installiert. Beide sind Mixture-of-Experts-Modelle: Von den vielen Milliarden Parametern sind pro Token nur ein Bruchteil aktiv. Das macht sie auf dieser Hardware schnell, ohne dass die Qualität großer Modelle verloren geht.

Der Rechner ist zugleich mein Demonstrationsgerät. Wer sehen will, was lokale KI heute leisten kann, sieht es hier live, mit eigenen Dokumenten und ohne Cloud.

Erste Erfahrung: ein Gutachten in unter drei Minuten

Mein Standardtest für jedes neue Modell ist eine echte Aufgabe aus meinem Beratungsalltag: ein Fachgutachten mit rund 30 Seiten anhand meiner eigenen Prüfchecklisten durchgehen. Prompt, Checklisten und Dokument sind bei jedem Durchlauf identisch, nur das Modell wechselt.

Mein aktueller Favorit ist Qwen3.8-35B-A3B-Distill. Das Modell hat 35 Milliarden Parameter, von denen pro Token nur rund drei Milliarden aktiv sind. Quantisiert habe ich es selbst: mit oMLX auf 8 Bit, ergänzt um Multi-Token-Prediction (MTP). Das hat nur Minuten gedauert. Das Ergebnis sind 80 bis 100 generierte Token pro Sekunde, und ein vollständiger Prüflauf über das Gutachten dauert weniger als drei Minuten.

Drei Dinge haben mich dabei überzeugt:

  • Das Gutachten verlässt meinen Schreibtisch nicht. Kein Upload, kein Dienst, keine Auftragsverarbeitung.
  • Die Prüflogik steckt in meinen Checklisten, nicht im Modell. Das Modell bleibt austauschbar. Kommt nächsten Monat ein besseres, tausche ich es aus, die Checklisten bleiben.
  • Keine Kosten pro Lauf. Ich kann beliebig oft prüfen lassen, Varianten vergleichen und Checklisten nachschärfen, ohne auf einen Token-Zähler zu schauen.

Der Modellvergleich: Qwen, Mistral, Nemotron und Kolibri

Wer heute ein Sprachmodell lokal betreiben will, hat eine riesige Auswahl. Die weniger gute Nachricht folgt daraus: Man muss wählen, und diese Wahl will gelernt sein.

Eine Woche lang habe ich deshalb verschiedene Modelle gegeneinander antreten lassen: Qwen, Mistral, Nemotron von NVIDIA und das neue Kolibri von Aleph Alpha, jeweils in unterschiedlichen Versionen, Parametergrößen und Quantisierungen, teilweise mit Multi-Token-Prediction. Zwei Fragen haben mich interessiert: Versteht das Modell das Fachwissen, das ich ihm explizit mitgebe? Und wie gut ist das, was es daraus bei einer anspruchsvollen Aufgabe macht?

Zunächst ein Kompliment an die Community rund um offene Modelle. Nahezu jedes Modell, das ich auf Hugging Face gefunden habe, ließ sich ohne Umwege laden, und auch die Python-Skripte zur Anpassung der Laufzeitumgebung funktionierten. Für einige Modelle habe ich eigene Quantisierungen erzeugt und sie passend auf den verfügbaren Speicher zugeschnitten. Dass das so reibungslos gelingt, zeigt, wie gut dieses Ökosystem inzwischen funktioniert.

Das Ergebnis des Vergleichs war ernüchternd und lehrreich zugleich. Fast jedes Ergebnis wirkte für sich genommen überzeugend und hielt einem ersten kritischen Blick stand. Erst als ich die Bewertungen nebeneinanderlegte, wurde sichtbar, wie weit sie auseinanderlagen.

Ein Beispiel: Ein Modell bemerkte im Unterschied zu allen anderen nicht, dass sich das Gutachten auf ein Vorhaben in einem Bundesland bezog, das mitgelieferte Fachwissen aber ausdrücklich für ein anderes Bundesland verfasst war. Das ist kein Urteil über das Modell insgesamt, sondern der Befund eines einzelnen Tests. Und im Grunde ist es auch kein großes Problem, denn eine solche Prüffrage lässt sich mühelos in die Checkliste aufnehmen. Man muss allerdings erst einmal darauf kommen.

Die eigentliche Erkenntnis: Wissen muss explizit werden

Damit verschiebt sich die Frage. Sie lautet nicht mehr nur, welches Modell das beste ist, sondern: Was muss ich an Wissen explizit formulieren, damit ein Modell für mich zuverlässig arbeitet?

Vieles, was eine erfahrene Fachkraft stillschweigend mitdenkt, etwa den räumlichen Geltungsbereich einer Vorschrift, muss für die Maschine ausdrücklich aufgeschrieben werden. Das Modell liefert Sprachverständnis und Schlussfolgerungen. Das Fachwissen, die Prüffragen und die Grenzen ihrer Anwendung liefere ich.

Mein Standpunkt: Wer komplexe Fachaufgaben einer KI anvertrauen will, kommt um eine sorgfältige Analyse der Kandidatenmodelle nicht herum. Dieser Aufwand ist nicht unerheblich. Man wird ein wenig zum Förster, der im raschen Wuchs der Sprachmodelle den Überblick behält. Der Lohn dafür ist ein System, dessen Prüflogik man selbst versteht und kontrolliert.

Was das für kleine Unternehmen und Verwaltungen bedeutet

Prüfaufgaben mit vertraulichen Unterlagen sind lokal machbar, mit Hardware, die auf einen Schreibtisch passt. Für kleine Unternehmen, Planungsbüros und Verwaltungen heißt das konkret:

  • Die Daten bleiben im Haus. Angebote, Verträge, Gutachten, Personalunterlagen gehen an keinen Dienst, dessen Bedingungen sich nächstes Jahr ändern können.
  • Volle Kontrolle. Welches Modell läuft und welche Daten es sieht, entscheidet das Unternehmen, nicht der Anbieter.
  • Keine laufenden Lizenzkosten für KI-Werkzeuge. Einmal investiert, dann läuft es. Jeder zusätzliche Prüflauf kostet nur Strom.
  • Das Wissen bleibt im Unternehmen. Checklisten und Fachwissen, die einmal für das Modell aufgeschrieben wurden, sind unabhängig vom Modell und bleiben als Dokumentation erhalten.

Ehrlich bleibt: Die großen Cloud-Modelle sind bei komplexen Aufgaben weiterhin stärker. Für einen großen Teil der täglichen Arbeit reicht aber, was lokal läuft. Und der Abstand schrumpft mit jeder Modellgeneration.

Was noch offen ist

Offen ist für mich, wie die Prüfqualität der lokalen Modelle im direkten Vergleich zu den großen Cloud-Modellen abschneidet. Daran arbeite ich gerade: dasselbe Gutachten, dieselben Checklisten, einmal lokal und einmal in der Cloud. Die Ergebnisse folgen in einem weiteren Beitrag.

Wer eine Demo sehen möchte: Kaiserslautern ist nicht weit, und ich komme mit dem Gerät auch gerne vorbei. Mitbringen dürfen Sie eigene Dokumente. Die bleiben nämlich bei Ihnen.

Quellen

Dieser Beitrag fasst drei LinkedIn-Beiträge zusammen:

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert