Ihre Modelle. Ihr Mac.
Ihre Daten bleiben zu Hause.
Führen Sie GGUF-Sprachmodelle vollständig auf Ihrem Mac mit Apple Silicon Metal GPU-Beschleunigung aus. Kein Internet erforderlich. Keine Daten verlassen Ihren Computer. Mischen Sie lokale und Cloud-Agenten in derselben Multi-Agent-Sitzung.
Was "lokale Inferenz" bedeutet in Roundtable AI
Wenn Sie ein GGUF-Modell in Roundtable AI laden, wird die gesamte Inferenzpipeline auf Ihrem Mac ausgeführt. Folgendes passiert unter der Haube:
GGUF-Format
GGUF ist ein Einzeldateiformat für quantisierte LLMs. Laden Sie eine .gguf-Datei von Hugging Face herunter und zeigen Sie Roundtable AI darauf. Keine Python-Umgebung, kein Docker, keine Abhängigkeitsinstallation.
Metal GPU-Beschleunigung
Inferenz wird auf der Metal-GPU von Apple Silicon ausgeführt, statt auf der CPU allein. Roundtable AI nutzt die einheitliche Speicherarchitektur von M1/M2/M3/M4-Chips, um Modelle für eine schnelle Token-Generierung GPU-resident zu halten.
Worker-Threads
Jedes geladene Modell wird in einem dedizierten Worker-Thread ausgeführt, der von der Benutzeroberfläche isoliert ist. Das Token-Streaming erfolgt in Echtzeit – Sie sehen, wie jeder Agent Zeichen für Zeichen denkt, ohne dass die App einfriert.
Keine Netzwerkaufrufe
Bei der Ausführung eines GGUF-Modells stellt Roundtable AI keine ausgehenden Netzwerkanforderungen. Ihre Eingabeaufforderungen, Antworten und Sitzungsdaten bleiben auf dem Gerät. Der Flugmodus funktioniert einwandfrei.
Hardware-Anleitung
Roundtable AI liest beim Start den einheitlichen Speicher Ihres Mac und warnt Sie, bevor Sie ihn überlasten. Folgendes können Sie auf jeder RAM-Ebene erwarten:
| Unified Memory | Was Sie ausführen können | Multi-Agent-Kapazität | Fit |
|---|---|---|---|
| 8 GB | Ein einzelnes 3B-Modell (z. B. Phi-3 Mini Q4) lässt wenig Spielraum. Eng für Sitzungen mit mehreren Agenten. | 1 lokaler Agent + Cloud-Agenten über OpenRouter | Eng |
| 16 GB | Zwei 3B-Modelle gleichzeitig oder ein 7B-Modell (z. B. Mistral). 7B Q4_K_M). Praktisches Minimum für lokale Multi-Agenten. | 2 lokale Agenten (3B) oder 1 lokaler (7B) + Cloud-Agenten | Minimum |
| 32 GB | Drei bis vier 7B-Modelle bei Q4-Quantisierung. Platz für Llama 3 8B, Mistral 7B und Gemma 2 9B gleichzeitig. | 3-4 lokale Agenten auf 7B-Modellen | Gut |
| 64 GB+ | 13B und sogar 30B-Modelle werden praktisch. Vollständige 8-Agenten-Sitzungen mit großen lokalen Modellen. | 6-8 lokale Agenten, größere Modelle | Ideal |
Drei Modellquellen, eine Sitzung
Jeder Agent in einem Roundtable AI-Sitzung wählt unabhängig ihre eigene Modellquelle aus. Mischen Sie alle drei in derselben Konversation.
Lokal GGUF
Zeigen Sie auf eine beliebige .gguf Datei auf Ihrem Mac. Die Inferenz wird auf dem Gerät mit Metal GPU ausgeführt. Unterstützt Modelle von Hugging Face: Mistral 7B, Llama 3 8B, Gemma 2, Phi-3 und alles andere im GGUF-Format. Vollständige Privatsphäre – keine Netzwerkanrufe. Neu hier? Siehe Auswählen eines lokalen Modells.
OpenRouter
Ein API-Schlüssel schaltet GPT-4o, Claude, Llama, Mistral Large und über 100 Cloud-Modelle frei. Nützlich, wenn Sie neben lokalen Modellen auch Argumentationen auf Grenzebene wünschen oder wenn Ihrem Mac der RAM für mehr lokale Agenten fehlt.
100+ ModelleOllama
Wenn Sie Ollama bereits verwenden, Roundtable AI erkennt automatisch die laufende Instanz und listet jedes Modell auf, das Sie heruntergeladen haben. Keine zusätzliche Konfiguration. Wählen Sie ein Modell aus und weisen Sie es einem Agenten zu.
Automatische ErkennungEin typisches Power-User-Setup: ein Agent auf einem lokalen Mistral 7B für Geschwindigkeit und Datenschutz, ein anderer auf GPT-4o über OpenRouter für komplexe Überlegungen und ein dritter auf einem von Ollama gehosteten Llama 3 zum Vergleich. Alle drei antworten im selben Gespräch aufeinander. Sehen Sie, wie dies im Vergleich zu einem Einzelmodell-Chatbot in Roundtable AI vs. ChatGPT.
Datenschutz nach Architektur
Datenschutz in Roundtable AI ist kein Umschalten – es ist eine Folge davon, wo die Berechnung stattfindet.
Lokal = nichts verlässt Ihr Mac
Wenn Sie ein GGUF-Modell verwenden, wird die Inferenz vollständig auf dem Gerät ausgeführt. Eingabeaufforderungen, Antworten und Sitzungsverlauf berühren niemals einen Server. Der Flugmodus funktioniert.
API-Schlüssel im Schlüsselbund
OpenRouter API-Schlüssel werden im Schlüsselbund macOS gespeichert, nicht in Nur-Text-Konfigurationsdateien. Derselbe Anmeldeinformationsspeicher, dem Ihr System für Passwörter und Zertifikate vertraut.
Keine Telemetrie
Roundtable AI sendet keine Analysen, Nutzungsdaten oder Absturzberichte an HighRoad Software. Es gibt kein Kontosystem. Es gibt keine Tracking-Pixel.
Lokaler SQLite-Speicher
Alle Sitzungsdaten werden in einer lokalen SQLite-Datenbank auf Ihrem Mac gespeichert. Exportieren Sie jederzeit nach Markdown, JSON, HTML oder PDF. Nichts ist mit der Cloud synchronisiert.
Erste Schritte mit lokalen Modellen
Drei Schritte. Kein Terminal. Kein Python. Kein Docker.
Laden Sie ein GGUF-Modell herunter
Gehen Sie zu Hugging Face und laden Sie eine .gguf-Datei herunter. Gute Ausgangspunkte: Mistral 7B Instruct Q4_K_M (~4,1 GB), Llama 3 8B Q4_K_M (~4,7 GB) oder Phi-3 Mini Q4 (~2,2 GB). Nicht sicher, welches? Lesen Sie Auswählen eines lokalen Modells. Speichern Sie es irgendwo auf Ihrem Mac.
Zeigen Sie mit Roundtable AI darauf
Öffnen Sie Roundtable AI, gehen Sie zu Einstellungen → Modelle und fügen Sie eine lokale GGUF-Verbindung hinzu. Wählen Sie Ihre .gguf-Datei aus. Die App validiert die Datei, meldet die geschätzte Speichernutzung und lädt sie auf die Metal GPU.
Agenten zuweisen und los geht
Erstellen Sie eine neue Sitzung, wählen Sie Ihre Personas aus und weisen Sie das lokale Modell einem oder mehreren Agenten zu. Mischen Sie es mit OpenRouter- oder Ollama-Agenten in derselben Sitzung. Klicken Sie auf „Start“ – Agenten beginnen sofort zu reagieren, Token für Token.
Häufig gestellte Fragen
ollama pull heruntergeladen haben, ist sofort verfügbar – keine zusätzliche Konfiguration. Wählen Sie ein Ollama-Modell aus und weisen Sie es einem Agenten zu, genauso wie Sie eine GGUF-Datei oder ein OpenRouter-Modell tun würden.
Probieren Sie noch heute lokale Inferenz aus
Roundtable AI ist auf dem Mac App Store kostenlos. Laden Sie ein GGUF-Modell herunter, richten Sie die App darauf und führen Sie Ihre erste lokale Multi-Agent-Sitzung in weniger als einer Minute aus.