Ihre Modelle. Ihr Mac.
Ihre Daten bleiben zu Hause.

Führen Sie GGUF-Sprachmodelle vollständig auf Ihrem Mac mit Apple Silicon Metal GPU-Beschleunigung aus. Kein Internet erforderlich. Keine Daten verlassen Ihren Computer. Mischen Sie lokale und Cloud-Agenten in derselben Multi-Agent-Sitzung.

Deep Dive

Was "lokale Inferenz" bedeutet in Roundtable AI

Wenn Sie ein GGUF-Modell in Roundtable AI laden, wird die gesamte Inferenzpipeline auf Ihrem Mac ausgeführt. Folgendes passiert unter der Haube:

GGUF-Format

GGUF ist ein Einzeldateiformat für quantisierte LLMs. Laden Sie eine .gguf-Datei von Hugging Face herunter und zeigen Sie Roundtable AI darauf. Keine Python-Umgebung, kein Docker, keine Abhängigkeitsinstallation.

Metal GPU-Beschleunigung

Inferenz wird auf der Metal-GPU von Apple Silicon ausgeführt, statt auf der CPU allein. Roundtable AI nutzt die einheitliche Speicherarchitektur von M1/M2/M3/M4-Chips, um Modelle für eine schnelle Token-Generierung GPU-resident zu halten.

Worker-Threads

Jedes geladene Modell wird in einem dedizierten Worker-Thread ausgeführt, der von der Benutzeroberfläche isoliert ist. Das Token-Streaming erfolgt in Echtzeit – Sie sehen, wie jeder Agent Zeichen für Zeichen denkt, ohne dass die App einfriert.

Keine Netzwerkaufrufe

Bei der Ausführung eines GGUF-Modells stellt Roundtable AI keine ausgehenden Netzwerkanforderungen. Ihre Eingabeaufforderungen, Antworten und Sitzungsdaten bleiben auf dem Gerät. Der Flugmodus funktioniert einwandfrei.

Hardware-Anleitung

Hardware-Anleitung

Roundtable AI liest beim Start den einheitlichen Speicher Ihres Mac und warnt Sie, bevor Sie ihn überlasten. Folgendes können Sie auf jeder RAM-Ebene erwarten:

Unified Memory Was Sie ausführen können Multi-Agent-Kapazität Fit
8 GB Ein einzelnes 3B-Modell (z. B. Phi-3 Mini Q4) lässt wenig Spielraum. Eng für Sitzungen mit mehreren Agenten. 1 lokaler Agent + Cloud-Agenten über OpenRouter Eng
16 GB Zwei 3B-Modelle gleichzeitig oder ein 7B-Modell (z. B. Mistral). 7B Q4_K_M). Praktisches Minimum für lokale Multi-Agenten. 2 lokale Agenten (3B) oder 1 lokaler (7B) + Cloud-Agenten Minimum
32 GB Drei bis vier 7B-Modelle bei Q4-Quantisierung. Platz für Llama 3 8B, Mistral 7B und Gemma 2 9B gleichzeitig. 3-4 lokale Agenten auf 7B-Modellen Gut
64 GB+ 13B und sogar 30B-Modelle werden praktisch. Vollständige 8-Agenten-Sitzungen mit großen lokalen Modellen. 6-8 lokale Agenten, größere Modelle Ideal
Modellquellen

Drei Modellquellen, eine Sitzung

Jeder Agent in einem Roundtable AI-Sitzung wählt unabhängig ihre eigene Modellquelle aus. Mischen Sie alle drei in derselben Konversation.

Lokal GGUF

Zeigen Sie auf eine beliebige .gguf Datei auf Ihrem Mac. Die Inferenz wird auf dem Gerät mit Metal GPU ausgeführt. Unterstützt Modelle von Hugging Face: Mistral 7B, Llama 3 8B, Gemma 2, Phi-3 und alles andere im GGUF-Format. Vollständige Privatsphäre – keine Netzwerkanrufe. Neu hier? Siehe Auswählen eines lokalen Modells.

Auf dem Gerät

OpenRouter

Ein API-Schlüssel schaltet GPT-4o, Claude, Llama, Mistral Large und über 100 Cloud-Modelle frei. Nützlich, wenn Sie neben lokalen Modellen auch Argumentationen auf Grenzebene wünschen oder wenn Ihrem Mac der RAM für mehr lokale Agenten fehlt.

100+ Modelle

Ollama

Wenn Sie Ollama bereits verwenden, Roundtable AI erkennt automatisch die laufende Instanz und listet jedes Modell auf, das Sie heruntergeladen haben. Keine zusätzliche Konfiguration. Wählen Sie ein Modell aus und weisen Sie es einem Agenten zu.

Automatische Erkennung

Ein typisches Power-User-Setup: ein Agent auf einem lokalen Mistral 7B für Geschwindigkeit und Datenschutz, ein anderer auf GPT-4o über OpenRouter für komplexe Überlegungen und ein dritter auf einem von Ollama gehosteten Llama 3 zum Vergleich. Alle drei antworten im selben Gespräch aufeinander. Sehen Sie, wie dies im Vergleich zu einem Einzelmodell-Chatbot in Roundtable AI vs. ChatGPT.

Datenschutz

Datenschutz nach Architektur

Datenschutz in Roundtable AI ist kein Umschalten – es ist eine Folge davon, wo die Berechnung stattfindet.

Lokal = nichts verlässt Ihr Mac

Wenn Sie ein GGUF-Modell verwenden, wird die Inferenz vollständig auf dem Gerät ausgeführt. Eingabeaufforderungen, Antworten und Sitzungsverlauf berühren niemals einen Server. Der Flugmodus funktioniert.

API-Schlüssel im Schlüsselbund

OpenRouter API-Schlüssel werden im Schlüsselbund macOS gespeichert, nicht in Nur-Text-Konfigurationsdateien. Derselbe Anmeldeinformationsspeicher, dem Ihr System für Passwörter und Zertifikate vertraut.

Keine Telemetrie

Roundtable AI sendet keine Analysen, Nutzungsdaten oder Absturzberichte an HighRoad Software. Es gibt kein Kontosystem. Es gibt keine Tracking-Pixel.

Lokaler SQLite-Speicher

Alle Sitzungsdaten werden in einer lokalen SQLite-Datenbank auf Ihrem Mac gespeichert. Exportieren Sie jederzeit nach Markdown, JSON, HTML oder PDF. Nichts ist mit der Cloud synchronisiert.

Erste Schritte

Erste Schritte mit lokalen Modellen

Drei Schritte. Kein Terminal. Kein Python. Kein Docker.

1

Laden Sie ein GGUF-Modell herunter

Gehen Sie zu Hugging Face und laden Sie eine .gguf-Datei herunter. Gute Ausgangspunkte: Mistral 7B Instruct Q4_K_M (~4,1 GB), Llama 3 8B Q4_K_M (~4,7 GB) oder Phi-3 Mini Q4 (~2,2 GB). Nicht sicher, welches? Lesen Sie Auswählen eines lokalen Modells. Speichern Sie es irgendwo auf Ihrem Mac.

2

Zeigen Sie mit Roundtable AI darauf

Öffnen Sie Roundtable AI, gehen Sie zu Einstellungen → Modelle und fügen Sie eine lokale GGUF-Verbindung hinzu. Wählen Sie Ihre .gguf-Datei aus. Die App validiert die Datei, meldet die geschätzte Speichernutzung und lädt sie auf die Metal GPU.

3

Agenten zuweisen und los geht

Erstellen Sie eine neue Sitzung, wählen Sie Ihre Personas aus und weisen Sie das lokale Modell einem oder mehreren Agenten zu. Mischen Sie es mit OpenRouter- oder Ollama-Agenten in derselben Sitzung. Klicken Sie auf „Start“ – Agenten beginnen sofort zu reagieren, Token für Token.

FAQ

Häufig gestellte Fragen

GGUF ist ein Dateiformat für quantisierte große Sprachmodelle. Sie laden eine einzelne Datei herunter (z. B. von Hugging Face) und führen sie lokal aus. Kein Python, kein Docker, kein Abhängigkeitsmanagement. Das Format unterstützt verschiedene Quantisierungsstufen (Q4, Q5, Q8), die die Modellqualität zugunsten der Speichernutzung beeinträchtigen.
16 GB einheitlicher Speicher sind das praktische Minimum für Multi-Agent-Sitzungen mit lokalen Modellen. Bei 16 GB können Sie zwei 3B-Modelle gleichzeitig betreiben. Bei 32 GB können Sie 3–4 Agenten auf 7B-Modellen wie Mistral 7B oder Llama 3 8B unterbringen. Mit 8 GB ist eine lokale Inferenz möglich, aber eng – erwägen Sie die Paarung eines lokalen Agenten mit Cloud-Agenten über OpenRouter.
Nein. Die lokale GGUF-Inferenz wird vollständig auf dem Gerät ausgeführt. Keine Daten verlassen Ihr Mac. Sie benötigen Internet nur, wenn Sie OpenRouter Cloud-Modelle verwenden – und selbst dann nur für diese spezifischen Agenten. Lokale Agenten arbeiten offline, im Flugzeug oder mit Ihrer Firewall, die den gesamten ausgehenden Datenverkehr blockiert.
Ja. Jeder Agent wählt unabhängig seine eigene Modellquelle aus. Ein Agent kann einen lokalen Mistral 7B ausführen, während ein anderer GPT-4o über OpenRouter verwendet und ein dritter einen von Ollama gehosteten Llama 3 verwendet. Alle drei reagieren im selben Gespräch aufeinander und sehen denselben gemeinsamen Kontext.
Roundtable AI erkennt automatisch eine laufende Ollama-Instanz auf Ihrem Mac. Jedes Modell, das Sie über ollama pull heruntergeladen haben, ist sofort verfügbar – keine zusätzliche Konfiguration. Wählen Sie ein Ollama-Modell aus und weisen Sie es einem Agenten zu, genauso wie Sie eine GGUF-Datei oder ein OpenRouter-Modell tun würden.

Probieren Sie noch heute lokale Inferenz aus

Roundtable AI ist auf dem Mac App Store kostenlos. Laden Sie ein GGUF-Modell herunter, richten Sie die App darauf und führen Sie Ihre erste lokale Multi-Agent-Sitzung in weniger als einer Minute aus.

Kostenlos herunterladen auf Mac Erfahren Sie mehr über Roundtable AI