Tus modelos. Tu Mac.
Tus datos se quedan en casa.
Ejecute modelos de lenguaje GGUF completamente en su Mac con aceleración de GPU Apple Silicon Metal. No se requiere internet. No salen datos de su máquina. Mezcle agentes locales y en la nube en la misma sesión de múltiples agentes.
¿Qué es la "inferencia local" significa en Roundtable AI
Cuando carga un modelo GGUF en Roundtable AI, toda la canalización de inferencia se ejecuta en su Mac. Esto es lo que sucede bajo el capó.
GGUF formato
GGUF es un formato de archivo único para LLM cuantificados. Descargue un archivo .gguf de Hugging Face y señale Roundtable AI hacia él. Sin entorno Python, sin Docker, sin instalación de dependencias.
Metal Aceleración de GPU
La inferencia se ejecuta en la GPU Metal de Apple Silicon, sino en la GPU, no únicamente en la CPU. Roundtable AI utiliza la arquitectura de memoria unificada de los chips M1/M2/M3/M4 para mantener los modelos residentes en la GPU para una generación rápida de tokens.
Subprocesos de trabajo
Cada modelo cargado se ejecuta en un subproceso de trabajo dedicado, aislado de la interfaz de usuario. La transmisión de tokens es en tiempo real: ve a cada agente pensar carácter por carácter sin que la aplicación se congele.
Sin llamadas de red
Cuando se ejecuta un modelo GGUF, Roundtable AI no realiza ninguna solicitud de red saliente. Sus indicaciones, respuestas y datos de sesión permanecen en el dispositivo. El modo avión funciona bien.
Guía de hardware
Roundtable AI lee la memoria unificada de tu Mac en el inicio y te advierte antes de sobrecargarla. Esto es lo que puede esperar de cada nivel de RAM.
| Memoria unificada | Qué puede ejecutar | Capacidad multiagente | Ajuste |
|---|---|---|---|
| 8 GB | Un solo modelo 3B (por ejemplo, Phi-3 Mini Q4) deja poco margen de maniobra. Ajustado para sesiones de múltiples agentes. | 1 agente local + agentes en la nube a través de OpenRouter | Estricto |
| 16 GB | Dos modelos 3B simultáneamente o un modelo 7B (p. ej., Mistral 7B Q4_K_M). Mínimo práctico para multiagente local. | 2 agentes locales (3B) o 1 local (7B) + agentes en la nube | Mínimo |
| 32 GB | Tres a cuatro modelos 7B en la cuantificación del cuarto trimestre. Espacio para Llama 3 8B, Mistral 7B y Gemma 2 9B al mismo tiempo. | 3-4 agentes locales en modelos 7B | Bueno |
| 64 GB+ | 13B e incluso Los modelos 30B se vuelven prácticos. Sesiones completas de 8 agentes con modelos locales grandes. | 6-8 agentes locales, modelos más grandes | Ideal |
Tres fuentes de modelo, una sesión
Cada agente en un Roundtable AI la sesión elige su propia fuente de modelo de forma independiente. Combine los tres en la misma conversación.
Local GGUF
Apunte a cualquier archivo .gguf en su Mac. La inferencia se ejecuta en el dispositivo con Metal GPU. Admite modelos de Hugging Face: Mistral 7B, Llama 3 8B, Gemma 2, Phi-3 y cualquier otro en formato GGUF. Privacidad total: sin llamadas de red. ¿Nuevo aquí? Consulte elegir un modelo local.
OpenRouter
Una clave API desbloquea GPT-4o, Claude, Llama, Mistral Large y más de 100 modelos en la nube. Útil cuando desea razonamiento a nivel de frontera junto con modelos locales, o cuando su Mac carece de RAM para más agentes locales.
Más de 100 modelosOllama
Si ya usa Ollama, Roundtable AI detecta automáticamente la instancia en ejecución y enumera todos los modelos que ha descargado. Sin configuración adicional. Seleccione un modelo y asígnelo a un agente.
Detección automáticaUna configuración típica de usuario avanzado: un agente en un Mistral 7B local para velocidad y privacidad, otro en GPT-4o a través de OpenRouter para razonamiento complejo y un tercero en un Llama 3 alojado en Ollama para comparar. Los tres se responden entre sí en la misma conversación. Vea cómo se compara esto con un chatbot de un solo modelo en Roundtable AI frente a ChatGPT.
Privacidad por arquitectura
Privacidad en Roundtable AI no es un interruptor, es una consecuencia de dónde ocurre el cálculo.
Local = nada sale de tu Mac
Cuando usas un modelo GGUF, la inferencia se ejecuta completamente en el dispositivo. Las indicaciones, las respuestas y el historial de sesiones nunca tocan un servidor. El modo avión funciona.
Las claves API en el llavero
OpenRouter Las claves API se almacenan en el llavero macOS, no en archivos de configuración de texto sin formato. El mismo almacén de credenciales en el que confía su sistema para contraseñas y certificados.
Sin telemetría
Roundtable AI no envía análisis, datos de uso ni informes de fallos a HighRoad Software. No existe un sistema de cuentas. No hay píxeles de seguimiento.
Almacenamiento local de SQLite
Todos los datos de la sesión se almacenan en una base de datos SQLite local en su Mac. Exporte a Markdown, JSON, HTML o PDF en cualquier momento. Nada está sincronizado con la nube.
Primeros pasos con modelos locales
Tres pasos. Sin terminales. Sin pitón. Sin Docker.
Descargue un modelo GGUF
Vaya a Hugging Face y descargue un archivo .gguf. Buenos puntos de partida: Mistral 7B Instruct Q4_K_M (~4,1 GB), Llama 3 8B Q4_K_M (~4,7 GB), o Phi-3 Mini Q4 (~2,2 GB). ¿No estás seguro de cuál? Lea elegir un modelo local. Guárdelo en cualquier lugar de su Mac.
Apunte Roundtable AI hacia él
Abra Roundtable AI, vaya a Configuración → Modelos y agregue una conexión local GGUF. Seleccione su archivo .gguf. La aplicación valida el archivo, informa el uso de memoria estimado y lo carga en la GPU Metal.
Asígnalo a los agentes y listo
Crea una nueva sesión, elige tus personajes y asigna el modelo local a uno o más agentes. Mezclar con agentes OpenRouter o Ollama en la misma sesión. Presiona Inicio: los agentes comienzan a responder inmediatamente, token por token.
Preguntas frecuentes
ollama pull está disponible de inmediato, sin configuración adicional. Seleccione un modelo Ollama y asígnelo a un agente de la misma manera que lo haría con un archivo GGUF o un modelo OpenRouter.
Pruebe la inferencia local hoy
Roundtable AI es gratuito en Mac App Store. Descargue un modelo GGUF, apunte la aplicación hacia él y ejecute su primera sesión multiagente local en menos de un minuto.