Von LLMs zu SLMs: Kleine AI-Sprachmodelle

KI benötigt viel Ressourcen

Eine intrinsische Eigenschaft von Large Language Models (LLMs) ist, dass sie eine sehr hohe Anzahl von Parametern aufweisen und die Ausführung selbst auf neuen Endnutzer-Computern sehr rechen- und speicher-intensiv ist.

Die meisten LLMs, welche sich herunterladen lassen und damit lokal auf dem eigenen Computer nutzbar sind, verfügen über mehrere Milliarden Parameter – einige Modelle kommen sogar mit mehreren Hundert Milliarden Parameter daher.

Selbst wenn das Sprachmodell mittels Quantisierung “komprimiert” wurde, werden meistens immer noch mehrere Gigabytes für die Speicherung und Ausführung benötigt.

Die Rolle von spezialisierter Hardware

Wenn keine AI-optimierte Hardware – bspw. eine Grafikkarte (GPU) oder sogar eine Tensor Processing Unit (TPU) – vorhanden ist, dann muss das Sprachmodell vollständig im Hauptspeicher (RAM) des Computers ausgeführt werden, wo es mit anderen Programmen und dem Betriebssystem um Ressourcen konkurrenziert.

Für die Ausführung von Sprachenmodellen auf dem eigenen Computer sind 4 GB RAM oft zu wenig und selbst 8 GB RAM sind für viele Sprachmodelle noch knapp.

Die Grösse des Sprachmodells schlägt sich auch auf die Performance bei der Ausführung durch. Je grösser ein Sprachmodell, desto aufwendiger die Berechnung des Outputs (Inferenz). Wenn keine AI-optimierte Hardware genutzt werden kann, muss die Inferenz durch die CPU ausgeführt werden. Die CPU ist jedoch nicht auf AI-Inferenz spezialisiert, sodass die Ausführung sehr langsam ist und anderen Anwendungen auf dem Computer (Browser, Office-Programme, etc) Ressourcen entzieht.

Für eine Aufrüstung des Computers mit spezialisierter AI-Hardware oder einfach mehr RAM-Speicher ist in vielen Fällen jedoch keine Bereitschaft vorhanden oder es ist technisch nicht möglich – v.a. bei mobilen Geräten.

Kleine Sprachmodelle zur Hilfe

Um Sprachmodelle auch auf Geräten mit geringeren Hardware-Ressourcen nutzen zu können, wurden deshalb “kleine” Large Language Models – oder einfach Small Language Models entwickelt.

Eines dieser kleinen Sprachmodelle ist “SmolLM”, welches in 3 Grössen daherkommt: mit 135, 360 und 1’700 Millionen Parameter.

Mittels Quantisierung wurden die Modelle noch weiter verkleinert, sodass deren Dateigrössen nur 92, 229 und 991 MB betragen. Mit einer Dateigrösse von lediglich 92 MB ist das kleinste “SmolLM” in der Tat sehr klein und passt auch in den RAM von älterer Hardware.



Digitalisierung: Tools, digitale Plattformen, Webseiten und Web-Applikationen – alles für die Prozessautomatisierung

Ihre Internet-Plattform, Webseite oder E-Commerce Lösung nach Mass

Prozesse zu automatisieren erfordert oft eine konsequente Digitalisierung – wir erstellen an Ihre Workflows angepasste Tools, entwickeln Plattformen für einen elektronischen Datenaustausch und erstellen auch massgeschneiderte Webseiten und interaktive Web-Applikationen.

  • Webseiten: Ihre Präsenz im Internet
    Webseiten: Ihre Präsenz im Internet

    Überall und jederzeit Mit einer Webseite sind Sie rund um die Uhr und überall auf der Welt präsent. Wir bauen Ihnen eine Webseite, die auf Ihre Bedürfnisse zugeschnitten ist. Sie bestimmen Layout, Farben und Aufbau. Falls Sie lieber zuerst ein paar Ideen suchen, geben wir Ihnen einen Überblick über gängige Design-Möglichkeiten. Eine Webseite kann in…

  • Web-Applikationen: Interaktive Plattformen, Shops und Applikationen
    Web-Applikationen: Interaktive Plattformen, Shops und Applikationen

    Web-Applikationen bieten Ihren Besuchern ein interaktives Erlebnis an – im Gegensatz zu Webseiten, welche in der Regel nur der Information dienen. Unter Web-Applikationen fallen bspw. E-Commerce Anwendungen wie Online-Shops oder Reservations- und Buchungs-Plattformen. Auch Plattformen für den Datei- oder Nachrichten-Austausch sowie Online-Fragebogen und Tests stellen eine Web-Applikation dar. Online-Shops Mit einem Online-Shop können Sie Ihre…

  • Web-Analytik & Web-Crawler Management
    Web-Analytik & Web-Crawler Management

    Betreiber von Webseiten sind oft mit zweierlei Aufgaben konfrontiert: die Zugriffe auf die Webseite zu messen und bei unerwünschten Crawlern (Roboter-Besucher) gegebenfalls Massnahmen wie eine Sperrung zu treffen. Web-Analytik mit lokaler Daten-Speicherung Viele Web-Analytik Lösungen erfordern die Übertragung von Daten an Drittparteien, was je nach Standort des Anbieters zahlreiche Implikationen hinsichtlich des Datenschutzes mit sich…

  • SEO: Von Suchmaschinen gefunden werden
    SEO: Von Suchmaschinen gefunden werden

    Der Wettbewerb um die besten Suchmaschinen-Plätze Im Internet gefunden werden, ist nicht einfach. Milliarden von anderen Webseiten konkurrenzieren darum, Besucher zu gewinnen. Eine zentrale Rolle bei der Gewinnung von Besuchern spielen Suchmaschinen wie Google, Bing, Yandex oder DuckDuckGo. Aber dort in die Top-Suchresultate zu gelangen, ist nicht einfach. Beim Aufbau der Webseite braucht es ein…

  • Beratung zu Hosting-Services
    Beratung zu Hosting-Services

    Komplexe Technologie im Hintergrund Damit eine Webseite von der ganzen Welt aus und auf allen möglichen Geräten zugänglich ist, benötigt es eine ganze Reihe an Technologien. Diese laufen so unauffällig im Hintergrund, dass die meisten Webseiten-Besucher sich gar keine Gedanken darüber machen solange alles funktioniert. Der Betrieb einer Webseite ist jedoch kein einfaches Unterfangen. Nachfolgend…

Blog


In unserem Blog finden Sie Beiträge mit Analysen, Zahlen und Visualisierungen aus den verschiedensten Themengebieten.

  • Das «grosse» Small Language Model: Überzeugt SmolLM 1.7b als AI-Sprachmodell ?

    Das grössere AI-Sprachmodell SmolLM 1.7b wartet mit 1.7 Milliarden (=billion) Parametern auf und sollte dadurch auch bessere Resultate als die (sehr) kleine Variante mit 135 Million Parametern liefern, was sich jedoch auch in längeren Wartezeiten niederschlagen wird. Beim Start des Modells fällt die Grösse auch merkbar ins Gewicht mit einer längeren Ladezeit von knapp 25…

    mehr erfahren >>

  • Kleine AI-Sprachmodelle: Was bietet SmolLM 135m?

    Die «SmolLM» Sprachmodelle lassen sich mit der Inferenz-Engine «Ollama» ausführen. Nach einer sehr kurzen Ladezeit von ca. 4 Sekunden (gewöhnlicher Desktop-Computer mit Intel GPU) steht das Modell bereits für die Eingabe zur Verfügung. Generierung von Text und Code Fangen wir an mit einer Frage, die eine klare Antwort hat: The term “Hauptstadt” is a German…

    mehr erfahren >>

  • Von LLMs zu SLMs: Kleine AI-Sprachmodelle

    KI benötigt viel Ressourcen Eine intrinsische Eigenschaft von Large Language Models (LLMs) ist, dass sie eine sehr hohe Anzahl von Parametern aufweisen und die Ausführung selbst auf neuen Endnutzer-Computern sehr rechen- und speicher-intensiv ist. Die meisten LLMs, welche sich herunterladen lassen und damit lokal auf dem eigenen Computer nutzbar sind, verfügen über mehrere Milliarden Parameter…

    mehr erfahren >>

  • Preis-Analyse mit statistischen Modellen – Teil 2

    Im ersten Teil der Serie haben wir gesehen, dass für die Gemälde in der Kunst-Boutique mit Hilfe von statistischen Modellen Analysen zum Preis gemacht werden können. Das statistische Modell, welches wir hier ansehen für die Modellierung der Beziehung zwischen Preis des Gemäldes (abhängige Variable) und den verschiedenen Eigenschaften (bspw. Alter, Grösse, Motif) ist die lineare…

    mehr erfahren >>

  • Interaktive Grafiken zur Inflation in der Schweiz

    Ein Bild sagt mehr als Tausend Worte! Analysieren Sie die Inflation in der Schweiz mit unseren interaktiven Grafiken mit monatlichen Daten und bis in die 1980er Jahre zurück. Mit den interaktiven Grafiken können Sie rein- und rauszoomen, Achsen verschieben, und einzelne Komponenten / Linien ein- und ausblenden. Wählen Sie aus der untenstehenden Liste aus:

    mehr erfahren >>

  • Preis-Analyse mit statistischen Modellen – Teil 1

    Algorithmen und statistische Modelle Auf dem Vorzeigeprodukt der Peleda GmbH, der Kunst-Boutique, sind zahlreiche Kunstwerke unterschiedlichster Stile, mit vielfältigen Motiven und unterschiedlichem Farbmaterial (Acryl, Öl, Tempera, Wasserfarbe) zu finden. Wie steht es mit dem Preis der Kunstwerke? Intuitiv ist klar, dass man für grössere Kunstwerke tendenziell eher mehr bezahlt. Aber lässt sich dies genauer quantifizieren…

    mehr erfahren >>

  • 40 Jahre Inflation in der Schweiz – Teil 4: Preistrends seitwärts und abwärts

    Die deflationären Komponenten: Preisrückgang auf lange Sicht Gibt es Index-Komponenten, welche längerfristig einen Preisrückgang aufweisen? Neben der im ersten Teil der Serie erwähnten Komponente «Nachrichtenübermittlung» lässt sich nur bei «Freizeit und Kultur» ein längerfristiger Preisrückgang identifizieren. Nach einem annualisierten Preisanstieg von 3.07% von 1983 bis 1993 gingen die Preise dann bis 2023 annualisiert um 0.22%…

    mehr erfahren >>