Uw modellen. Uw Mac.
Uw gegevens blijven thuis.

Voer GGUF taalmodellen volledig uit op uw Mac met Apple Silicon Metal GPU-versnelling. Geen internet vereist. Er verlaten geen gegevens uw machine. Combineer lokale en cloudagenten in dezelfde sessie met meerdere agenten.

Deep Dive

Wat "lokale gevolgtrekking" betekent in Roundtable AI

Wanneer u een GGUF model laadt in Roundtable AI, wordt de volledige inferentiepijplijn uitgevoerd op uw Mac. Dit is wat er onder de motorkap gebeurt.

GGUF-indeling

GGUF is een indeling met één bestand voor gekwantiseerde LLM's. Download een .gguf bestand van Hugging Face en wijs Roundtable AI ernaar. Geen Python-omgeving, geen Docker, geen afhankelijkheidsinstallatie.

Metal GPU-versnelling

Inferentie wordt uitgevoerd op de Metal-GPU van Apple Silicon, en niet uitsluitend op de CPU. Roundtable AI maakt gebruik van de uniforme geheugenarchitectuur van M1/M2/M3/M4-chips om de modellen GPU-resident te houden voor snelle tokengeneratie.

Werkthreads

Elk geladen model wordt uitgevoerd in een speciale werkthread, geïsoleerd van de gebruikersinterface. Tokenstreaming is realtime: u ziet elke agent karakter voor karakter denken zonder dat de app vastloopt.

Geen netwerkoproepen

Als u een GGUF-model gebruikt, doet Roundtable AI geen uitgaande netwerkverzoeken. Uw prompts, antwoorden en sessiegegevens blijven op het apparaat staan. De vliegtuigmodus werkt prima.

Hardwarebegeleiding

Hardwarebegeleiding

Roundtable AI leest het uniforme geheugen van uw Mac's bij het opstarten en waarschuwt u voordat u het overbelast. Dit is wat u kunt verwachten bij elke RAM-laag.

Unified Memory Wat u kunt uitvoeren Multi-agent capaciteit Passend
8 GB A het enkele 3B-model (bijv. Phi-3 Mini Q4) laat weinig hoofdruimte over. Krap voor sessies met meerdere agenten. 1 lokale agent + cloudagenten via OpenRouter Krap
16 GB Twee 3B-modellen tegelijk, of één 7B-model (bijvoorbeeld Mistral 7B Q4_K_M). Praktisch minimum voor lokale multi-agent. 2 lokale agenten (3B) of 1 lokale (7B) + cloudagenten Minimaal
32 GB Drie tot vier 7B-modellen bij Q4-kwantisering. Ruimte voor Llama 3 8B, Mistral 7B en Gemma 2 9B tegelijkertijd. 3-4 lokale agenten op 7B-modellen Goed
64 GB+ 13B en zelfs 30B modellen worden praktisch. Volledige sessies met 8 agenten met grote lokale modellen. 6-8 lokale agenten, grotere modellen Ideaal
Modelbronnen

Drie modelbronnen, één sessie

Elke agent in een Roundtable AI sessie kiest onafhankelijk zijn eigen modelbron. Combineer ze alle drie in hetzelfde gesprek.

Lokaal GGUF

Wijs naar een .gguf bestand op uw Mac. Inference wordt op het apparaat uitgevoerd met Metal GPU. Ondersteunt modellen van Hugging Face: Mistral 7B, Llama 3 8B, Gemma 2, Phi-3 en al het andere in GGUF formaat. Volledige privacy - geen netwerkoproepen. Nieuw hier? Zie een lokaal model kiezen.

Op het apparaat

OpenRouter

Eén API-sleutel ontgrendelt GPT-4o, Claude, Llama, Mistral Large en meer dan 100 cloudmodellen. Handig als u naast lokale modellen ook op grensniveau wilt redeneren, of als uw Mac het RAM-geheugen voor meer lokale agenten mist.

100+ modellen

Ollama

Als u Ollama, Roundtable AI al gebruikt detecteert automatisch het actieve exemplaar en vermeldt elk model dat u hebt gedownload. Geen extra configuratie. Selecteer een model en wijs het toe aan een agent.

Automatische detectie

Een typische configuratie voor krachtige gebruikers: één agent op een lokale Mistral 7B voor snelheid en privacy, een andere op GPT-4o via OpenRouter voor complex redeneren, en een derde op een door Ollama gehoste Llama 3 ter vergelijking. Alle drie reageren ze op elkaar in hetzelfde gesprek. Bekijk hoe dit zich verhoudt tot een chatbot met één model in Roundtable AI versus ChatGPT.

Privacy

Privacy per architectuur

Privacy in Roundtable AI is geen toggle — dit is een gevolg van waar de berekening plaatsvindt.

Lokaal = niets verlaat uw Mac

Als u een GGUF-model gebruikt, wordt de gevolgtrekking volledig op het apparaat uitgevoerd. Prompts, antwoorden en sessiegeschiedenis raken nooit een server. De vliegtuigmodus werkt.

API-sleutels in sleutelhanger

OpenRouter API-sleutels worden opgeslagen in de macOS sleutelhanger, niet in configuratiebestanden met platte tekst. Dezelfde gegevensopslag die uw systeem vertrouwt voor wachtwoorden en certificaten.

Geen telemetrie

Roundtable AI verzendt geen analyses, gebruiksgegevens of crashrapporten naar HighRoad Software. Er is geen rekeningsysteem. Er zijn geen trackingpixels.

Lokale SQLite-opslag

Alle sessiegegevens worden opgeslagen in een lokale SQLite-database op uw Mac. Exporteer op elk gewenst moment naar Markdown, JSON, HTML of PDF. Niets wordt in de cloud gesynchroniseerd.

Aan de slag

Aan de slag met lokale modellen

Drie stappen. Geen terminal. Geen Python. Geen Docker.

1

Download een GGUF model

Ga naar Knuffelend gezicht en download een .gguf bestand. Goede uitgangspunten: Mistral 7B Instrueer Q4_K_M (~4,1 GB), Llama 3 8B Q4_K_M (~4,7 GB), of Phi-3 Mini Q4 (~2,2 GB). Weet u niet zeker welke? Lees het kiezen van een lokaal model. Sla het overal op uw Mac op.

2

Wijs Roundtable AI ernaar

Open Roundtable AI, ga naar Instellingen → Modellen en voeg een lokale GGUF verbinding toe. Selecteer uw .gguf bestand. De app valideert het bestand, rapporteert het geschatte geheugengebruik en laadt het op de Metal GPU.

3

Wijs het toe aan agenten en ga aan de slag

Maak een nieuwe sessie, kies uw persona's en wijs het lokale model toe aan een of meer agenten. Meng met OpenRouter of Ollama agenten in dezelfde sessie. Druk op de start: agenten reageren onmiddellijk, token voor token.

Veelgestelde vragen

Veelgestelde vragen

GGUF is een bestandsformaat voor gekwantiseerde grote taalmodellen. U downloadt een enkel bestand (bijvoorbeeld van Hugging Face) en voert het lokaal uit. Geen Python, geen Docker, geen afhankelijkheidsbeheer. Het formaat ondersteunt verschillende kwantiseringsniveaus (Q4, Q5, Q8) die de modelkwaliteit inruilen voor geheugengebruik.
16 GB uniform geheugen is het praktische minimum voor sessies met meerdere agenten met lokale modellen. Met 16 GB kunt u twee 3B-modellen tegelijkertijd gebruiken. Met 32 ​​GB kun je 3-4 agenten vervoeren op 7B-modellen zoals Mistral 7B of Llama 3 8B. Met 8 GB is lokale inferentie mogelijk, maar krap. Overweeg om één lokale agent te koppelen aan cloudagents via OpenRouter.
Nee. Lokale GGUF-inferentie wordt volledig op het apparaat uitgevoerd. Er verlaten geen gegevens uw Mac. Je hebt alleen internet nodig als je OpenRouter cloudmodellen gebruikt – en zelfs dan alleen voor die specifieke agenten. Lokale agenten werken offline, in een vliegtuig of terwijl uw firewall al het uitgaande verkeer blokkeert.
Ja. Elke agent kiest onafhankelijk zijn eigen modelbron. De ene agent kan een lokale Mistral 7B gebruiken, terwijl de andere GPT-4o gebruikt via OpenRouter en een derde een door Ollama gehoste Llama 3 gebruikt. Alle drie reageren ze op elkaar in hetzelfde gesprek en zien ze dezelfde gedeelde context.
Roundtable AI detecteert automatisch een actieve Ollama-instantie op uw Mac. Elk model dat u via ollama pull heeft gedownload, is onmiddellijk beschikbaar – zonder extra configuratie. Selecteer een Ollama-model en wijs het toe aan een agent op dezelfde manier als u een GGUF-bestand of een OpenRouter-model zou doen.

Probeer vandaag nog lokale inferentie

Roundtable AI is gratis op Mac App Store. Download een GGUF-model, richt de app erop en voer binnen een minuut uw eerste lokale multi-agentsessie uit.

Gratis downloaden op Mac Meer informatie over Roundtable AI