Vos modèles. Votre Mac.
Vos données restent à la maison.
Exécutez les modèles de langage GGUF entièrement sur votre Mac avec l'accélération GPU Apple Silicon Metal. Aucune connexion Internet requise. Aucune donnée ne quitte votre machine. Mélangez des agents locaux et cloud dans la même session multi-agent.
Qu'est-ce que "l'inférence locale" ? signifie dans Roundtable AI
Lorsque vous chargez un modèle GGUF dans Roundtable AI, l'intégralité du pipeline d'inférence s'exécute sur votre Mac. Voici ce qui se passe sous le capot.
Format GGUF
GGUF est un format de fichier unique pour les LLM quantifiés. Téléchargez un fichier .gguf depuis Hugging Face et pointez Roundtable AI dessus. Pas d'environnement Python, pas de Docker, pas d'installation de dépendances.
Metal Accélération GPU
L'inférence s'exécute sur le GPU Metal de Apple Silicon, et non sur le processeur uniquement. Roundtable AI utilise l'architecture de mémoire unifiée des puces M1/M2/M3/M4 pour conserver les modèles résidant sur le GPU pour une génération rapide de jetons.
Threads de travail
Chaque modèle chargé s'exécute dans un thread de travail dédié, isolé de l'interface utilisateur. Le streaming de jetons s'effectue en temps réel : vous voyez chaque agent réfléchir caractère par caractère sans que l'application ne se fige.
Aucun appel réseau
Lors de l'exécution d'un modèle GGUF, Roundtable AI n'effectue aucune requête réseau sortante. Vos invites, réponses et données de session restent sur l'appareil. Le mode avion fonctionne correctement.
Guide matériel
Roundtable AI lit la mémoire unifiée de votre Mac'au lancement et vous avertit avant de la surcharger. Voici à quoi vous attendre à chaque niveau de RAM.
| Mémoire unifiée | Ce que vous pouvez exécuter | Capacité multi-agent | Ajustement |
|---|---|---|---|
| 8 Go | Un seul modèle 3B (par exemple, Phi-3 Mini Q4) laisse peu de marge. Idéal pour les sessions multi-agents. | 1 agent local + agents cloud via OpenRouter | Tight |
| 16 Go | Deux modèles 3B simultanément, ou un modèle 7B (par exemple, Mistral 7B Q4_K_M). Minimum pratique pour multi-agent local. | 2 agents locaux (3B) ou 1 local (7B) + agents cloud | Minimum |
| 32 Go | Trois à quatre modèles 7B à la quantification Q4. De la place pour Llama 3 8B, Mistral 7B et Gemma 2 9B en même temps. | 3 à 4 agents locaux sur les modèles 7B | Bon |
| 64 Go+ | 13B et même les modèles 30B deviennent pratiques. Sessions complètes de 8 agents avec de grands modèles locaux. | 6 à 8 agents locaux, modèles plus grands | Idéal |
Trois sources de modèle, une session
Chaque agent dans un Roundtable AI sélectionne indépendamment sa propre source de modèle. Mélangez les trois dans la même conversation.
Local GGUF
Pointez sur n'importe quel fichier .gguf sur votre Mac. L'inférence s'exécute sur l'appareil avec le GPU Metal. Prend en charge les modèles de Hugging Face : Mistral 7B, Llama 3 8B, Gemma 2, Phi-3 et tout le reste au format GGUF. Confidentialité totale – pas d’appels réseau. Nouveau ici ? Voir choisir un modèle local.
OpenRouter
Une clé API déverrouille GPT-4o, Claude, Llama, Mistral Large et plus de 100 clouds. modèles. Utile lorsque vous souhaitez un raisonnement au niveau de la frontière aux côtés de modèles locaux, ou lorsque votre Mac ne dispose pas de RAM pour davantage d'agents locaux.
Plus de 100 modèlesOllama
Si vous utilisez déjà Ollama, Roundtable AI détecte automatiquement l'instance en cours d'exécution et répertorie tous les modèles que vous avez téléchargés. Aucune configuration supplémentaire. Sélectionnez un modèle et attribuez-le à un agent.
Détection automatiqueUne configuration d'utilisateur expérimenté typique : un agent sur un Mistral 7B local pour la vitesse et la confidentialité, un autre sur GPT-4o via OpenRouter pour un raisonnement complexe, et un troisième sur un Llama 3 hébergé par Ollama pour comparaison. Tous les trois se répondent dans la même conversation. Comparez cela à un chatbot à modèle unique dans Roundtable AI et ChatGPT.
Confidentialité par architecture
Confidentialité dans Roundtable AI n'est pas une bascule : c'est une conséquence de l'endroit où le calcul a lieu.
Local = rien ne quitte votre Mac
Lorsque vous utilisez un modèle GGUF, l'inférence s'exécute entièrement sur l'appareil. Les invites, les réponses et l'historique des sessions ne touchent jamais un serveur. Le mode avion fonctionne.
Les clés API dans le trousseau
OpenRouter Les clés API sont stockées dans le trousseau macOS, et non dans les fichiers de configuration en texte brut. Les mêmes informations d'identification stockent les confiances de votre système pour les mots de passe et les certificats.
Aucune télémétrie
Roundtable AI n'envoie aucune analyse, donnée d'utilisation ou rapport d'erreur à HighRoad Software. Il n'y a pas de système de compte. Il n'y a pas de pixels de suivi.
Stockage SQLite local
Toutes les données de session sont stockées dans une base de données SQLite locale sur votre Mac. Exportez vers Markdown, JSON, HTML ou PDF à tout moment. Rien n'est synchronisé avec le cloud.
Démarrage avec les modèles locaux
Trois étapes. Pas de borne. Pas de Python. Pas de Docker.
Téléchargez un modèle GGUF
Accédez à Hugging Face et téléchargez un fichier .gguf. Bons points de départ : Mistral 7B Instruct Q4_K_M (~4,1 Go), Llama 3 8B Q4_K_M (~4,7 Go), ou Phi-3 Mini Q4 (~ 2,2 Go). Vous ne savez pas lequel ? Lisez choisir un modèle local. Enregistrez-le n'importe où sur votre Mac.
Pointez Roundtable AI dessus
Ouvrir Roundtable AI, accédez à Paramètres → Modèles et ajoutez une connexion locale GGUF. Sélectionnez votre fichier .gguf. L'application valide le fichier, rapporte l'utilisation estimée de la mémoire et le charge sur le GPU Metal.
Attribuez-le aux agents et c'est parti
Créez une nouvelle session, choisissez vos personnages et attribuez le modèle local à un ou plusieurs agents. Mélangez avec les agents OpenRouter ou Ollama dans la même session. Appuyez sur Démarrer : les agents commencent à répondre immédiatement, jeton par jeton.
Fréquemment demandée
ollama pull est disponible immédiatement — aucune configuration supplémentaire. Sélectionnez un modèle Ollama et attribuez-le à un agent de la même manière qu'un fichier GGUF ou un modèle OpenRouter.
Essayez l'inférence locale dès aujourd'hui
Roundtable AI est gratuit sur le Mac App Store. Téléchargez un modèle GGUF, pointez l'application vers celui-ci et exécutez votre première session multi-agent locale en moins d'une minute.