Vos modèles. Votre Mac.
Vos données restent à la maison.

Exécutez les modèles de langage GGUF entièrement sur votre Mac avec l'accélération GPU Apple Silicon Metal. Aucune connexion Internet requise. Aucune donnée ne quitte votre machine. Mélangez des agents locaux et cloud dans la même session multi-agent.

Exploration approfondie

Qu'est-ce que "l'inférence locale" ? signifie dans Roundtable AI

Lorsque vous chargez un modèle GGUF dans Roundtable AI, l'intégralité du pipeline d'inférence s'exécute sur votre Mac. Voici ce qui se passe sous le capot.

Format GGUF

GGUF est un format de fichier unique pour les LLM quantifiés. Téléchargez un fichier .gguf depuis Hugging Face et pointez Roundtable AI dessus. Pas d'environnement Python, pas de Docker, pas d'installation de dépendances.

Metal Accélération GPU

L'inférence s'exécute sur le GPU Metal de Apple Silicon, et non sur le processeur uniquement. Roundtable AI utilise l'architecture de mémoire unifiée des puces M1/M2/M3/M4 pour conserver les modèles résidant sur le GPU pour une génération rapide de jetons.

Threads de travail

Chaque modèle chargé s'exécute dans un thread de travail dédié, isolé de l'interface utilisateur. Le streaming de jetons s'effectue en temps réel : vous voyez chaque agent réfléchir caractère par caractère sans que l'application ne se fige.

Aucun appel réseau

Lors de l'exécution d'un modèle GGUF, Roundtable AI n'effectue aucune requête réseau sortante. Vos invites, réponses et données de session restent sur l'appareil. Le mode avion fonctionne correctement.

Guide matériel

Guide matériel

Roundtable AI lit la mémoire unifiée de votre Mac'au lancement et vous avertit avant de la surcharger. Voici à quoi vous attendre à chaque niveau de RAM.

Mémoire unifiée Ce que vous pouvez exécuter Capacité multi-agent Ajustement
8 Go Un seul modèle 3B (par exemple, Phi-3 Mini Q4) laisse peu de marge. Idéal pour les sessions multi-agents. 1 agent local + agents cloud via OpenRouter Tight
16 Go Deux modèles 3B simultanément, ou un modèle 7B (par exemple, Mistral 7B Q4_K_M). Minimum pratique pour multi-agent local. 2 agents locaux (3B) ou 1 local (7B) + agents cloud Minimum
32 Go Trois à quatre modèles 7B à la quantification Q4. De la place pour Llama 3 8B, Mistral 7B et Gemma 2 9B en même temps. 3 à 4 agents locaux sur les modèles 7B Bon
64 Go+ 13B et même les modèles 30B deviennent pratiques. Sessions complètes de 8 agents avec de grands modèles locaux. 6 à 8 agents locaux, modèles plus grands Idéal
Sources de modèle

Trois sources de modèle, une session

Chaque agent dans un Roundtable AI sélectionne indépendamment sa propre source de modèle. Mélangez les trois dans la même conversation.

Local GGUF

Pointez sur n'importe quel fichier .gguf sur votre Mac. L'inférence s'exécute sur l'appareil avec le GPU Metal. Prend en charge les modèles de Hugging Face : Mistral 7B, Llama 3 8B, Gemma 2, Phi-3 et tout le reste au format GGUF. Confidentialité totale – pas d’appels réseau. Nouveau ici ? Voir choisir un modèle local.

Sur l'appareil

OpenRouter

Une clé API déverrouille GPT-4o, Claude, Llama, Mistral Large et plus de 100 clouds. modèles. Utile lorsque vous souhaitez un raisonnement au niveau de la frontière aux côtés de modèles locaux, ou lorsque votre Mac ne dispose pas de RAM pour davantage d'agents locaux.

Plus de 100 modèles

Ollama

Si vous utilisez déjà Ollama, Roundtable AI détecte automatiquement l'instance en cours d'exécution et répertorie tous les modèles que vous avez téléchargés. Aucune configuration supplémentaire. Sélectionnez un modèle et attribuez-le à un agent.

Détection automatique

Une configuration d'utilisateur expérimenté typique : un agent sur un Mistral 7B local pour la vitesse et la confidentialité, un autre sur GPT-4o via OpenRouter pour un raisonnement complexe, et un troisième sur un Llama 3 hébergé par Ollama pour comparaison. Tous les trois se répondent dans la même conversation. Comparez cela à un chatbot à modèle unique dans Roundtable AI et ChatGPT.

Confidentialité

Confidentialité par architecture

Confidentialité dans Roundtable AI n'est pas une bascule : c'est une conséquence de l'endroit où le calcul a lieu.

Local = rien ne quitte votre Mac

Lorsque vous utilisez un modèle GGUF, l'inférence s'exécute entièrement sur l'appareil. Les invites, les réponses et l'historique des sessions ne touchent jamais un serveur. Le mode avion fonctionne.

Les clés API dans le trousseau

OpenRouter Les clés API sont stockées dans le trousseau macOS, et non dans les fichiers de configuration en texte brut. Les mêmes informations d'identification stockent les confiances de votre système pour les mots de passe et les certificats.

Aucune télémétrie

Roundtable AI n'envoie aucune analyse, donnée d'utilisation ou rapport d'erreur à HighRoad Software. Il n'y a pas de système de compte. Il n'y a pas de pixels de suivi.

Stockage SQLite local

Toutes les données de session sont stockées dans une base de données SQLite locale sur votre Mac. Exportez vers Markdown, JSON, HTML ou PDF à tout moment. Rien n'est synchronisé avec le cloud.

Démarrage

Démarrage avec les modèles locaux

Trois étapes. Pas de borne. Pas de Python. Pas de Docker.

1

Téléchargez un modèle GGUF

Accédez à Hugging Face et téléchargez un fichier .gguf. Bons points de départ : Mistral 7B Instruct Q4_K_M (~4,1 Go), Llama 3 8B Q4_K_M (~4,7 Go), ou Phi-3 Mini Q4 (~ 2,2 Go). Vous ne savez pas lequel ? Lisez choisir un modèle local. Enregistrez-le n'importe où sur votre Mac.

2

Pointez Roundtable AI dessus

Ouvrir Roundtable AI, accédez à Paramètres → Modèles et ajoutez une connexion locale GGUF. Sélectionnez votre fichier .gguf. L'application valide le fichier, rapporte l'utilisation estimée de la mémoire et le charge sur le GPU Metal.

3

Attribuez-le aux agents et c'est parti

Créez une nouvelle session, choisissez vos personnages et attribuez le modèle local à un ou plusieurs agents. Mélangez avec les agents OpenRouter ou Ollama dans la même session. Appuyez sur Démarrer : les agents commencent à répondre immédiatement, jeton par jeton.

FAQ

Fréquemment demandée

GGUF est un format de fichier pour les grands modèles de langage quantifiés. Vous téléchargez un seul fichier (par exemple, à partir de Hugging Face) et l'exécutez localement. Pas de Python, pas de Docker, pas de gestion des dépendances. Le format prend en charge différents niveaux de quantification (Q4, Q5, Q8) qui compromettent la qualité du modèle en termes d'utilisation de la mémoire.
16 Go de mémoire unifiée constituent le minimum pratique pour les sessions multi-agents avec des modèles locaux. Avec 16 Go, vous pouvez exécuter deux modèles 3B simultanément. Avec 32 Go, vous pouvez asseoir 3 à 4 agents sur les modèles 7B comme Mistral 7B ou Llama 3 8B. Avec 8 Go, l'inférence locale est possible mais limitée : pensez à associer un agent local à des agents cloud via OpenRouter.
Non. L'inférence locale GGUF s'exécute entièrement sur l'appareil. Aucune donnée ne quitte votre Mac. Vous n'avez besoin d'Internet que si vous utilisez des modèles cloud OpenRouter — et même dans ce cas, uniquement pour ces agents spécifiques. Les agents locaux travaillent hors ligne, dans un avion ou avec votre pare-feu bloquant tout le trafic sortant.
Oui. Chaque agent sélectionne indépendamment sa propre source de modèle. Un agent peut exécuter un Mistral 7B local tandis qu'un autre utilise GPT-4o via OpenRouter et un troisième utilise un Llama 3 hébergé par Ollama. Tous les trois se répondent dans la même conversation, voyant le même contexte partagé.
Roundtable AI détecte automatiquement une instance Ollama en cours d'exécution sur votre Mac. Tout modèle que vous avez téléchargé via ollama pull est disponible immédiatement — aucune configuration supplémentaire. Sélectionnez un modèle Ollama et attribuez-le à un agent de la même manière qu'un fichier GGUF ou un modèle OpenRouter.

Essayez l'inférence locale dès aujourd'hui

Roundtable AI est gratuit sur le Mac App Store. Téléchargez un modèle GGUF, pointez l'application vers celui-ci et exécutez votre première session multi-agent locale en moins d'une minute.

Téléchargez gratuitement sur Mac En savoir plus sur Roundtable AI