Tus modelos. Tu Mac.
Tus datos se quedan en casa.

Ejecute modelos de lenguaje GGUF completamente en su Mac con aceleración de GPU Apple Silicon Metal. No se requiere internet. No salen datos de su máquina. Mezcle agentes locales y en la nube en la misma sesión de múltiples agentes.

Deep Dive

¿Qué es la "inferencia local" significa en Roundtable AI

Cuando carga un modelo GGUF en Roundtable AI, toda la canalización de inferencia se ejecuta en su Mac. Esto es lo que sucede bajo el capó.

GGUF formato

GGUF es un formato de archivo único para LLM cuantificados. Descargue un archivo .gguf de Hugging Face y señale Roundtable AI hacia él. Sin entorno Python, sin Docker, sin instalación de dependencias.

Metal Aceleración de GPU

La inferencia se ejecuta en la GPU Metal de Apple Silicon, sino en la GPU, no únicamente en la CPU. Roundtable AI utiliza la arquitectura de memoria unificada de los chips M1/M2/M3/M4 para mantener los modelos residentes en la GPU para una generación rápida de tokens.

Subprocesos de trabajo

Cada modelo cargado se ejecuta en un subproceso de trabajo dedicado, aislado de la interfaz de usuario. La transmisión de tokens es en tiempo real: ve a cada agente pensar carácter por carácter sin que la aplicación se congele.

Sin llamadas de red

Cuando se ejecuta un modelo GGUF, Roundtable AI no realiza ninguna solicitud de red saliente. Sus indicaciones, respuestas y datos de sesión permanecen en el dispositivo. El modo avión funciona bien.

Guía de hardware

Guía de hardware

Roundtable AI lee la memoria unificada de tu Mac en el inicio y te advierte antes de sobrecargarla. Esto es lo que puede esperar de cada nivel de RAM.

Memoria unificada Qué puede ejecutar Capacidad multiagente Ajuste
8 GB Un solo modelo 3B (por ejemplo, Phi-3 Mini Q4) deja poco margen de maniobra. Ajustado para sesiones de múltiples agentes. 1 agente local + agentes en la nube a través de OpenRouter Estricto
16 GB Dos modelos 3B simultáneamente o un modelo 7B (p. ej., Mistral 7B Q4_K_M). Mínimo práctico para multiagente local. 2 agentes locales (3B) o 1 local (7B) + agentes en la nube Mínimo
32 GB Tres a cuatro modelos 7B en la cuantificación del cuarto trimestre. Espacio para Llama 3 8B, Mistral 7B y Gemma 2 9B al mismo tiempo. 3-4 agentes locales en modelos 7B Bueno
64 GB+ 13B e incluso Los modelos 30B se vuelven prácticos. Sesiones completas de 8 agentes con modelos locales grandes. 6-8 agentes locales, modelos más grandes Ideal
Fuentes de modelo

Tres fuentes de modelo, una sesión

Cada agente en un Roundtable AI la sesión elige su propia fuente de modelo de forma independiente. Combine los tres en la misma conversación.

Local GGUF

Apunte a cualquier archivo .gguf en su Mac. La inferencia se ejecuta en el dispositivo con Metal GPU. Admite modelos de Hugging Face: Mistral 7B, Llama 3 8B, Gemma 2, Phi-3 y cualquier otro en formato GGUF. Privacidad total: sin llamadas de red. ¿Nuevo aquí? Consulte elegir un modelo local.

En el dispositivo

OpenRouter

Una clave API desbloquea GPT-4o, Claude, Llama, Mistral Large y más de 100 modelos en la nube. Útil cuando desea razonamiento a nivel de frontera junto con modelos locales, o cuando su Mac carece de RAM para más agentes locales.

Más de 100 modelos

Ollama

Si ya usa Ollama, Roundtable AI detecta automáticamente la instancia en ejecución y enumera todos los modelos que ha descargado. Sin configuración adicional. Seleccione un modelo y asígnelo a un agente.

Detección automática

Una configuración típica de usuario avanzado: un agente en un Mistral 7B local para velocidad y privacidad, otro en GPT-4o a través de OpenRouter para razonamiento complejo y un tercero en un Llama 3 alojado en Ollama para comparar. Los tres se responden entre sí en la misma conversación. Vea cómo se compara esto con un chatbot de un solo modelo en Roundtable AI frente a ChatGPT.

Privacidad

Privacidad por arquitectura

Privacidad en Roundtable AI no es un interruptor, es una consecuencia de dónde ocurre el cálculo.

Local = nada sale de tu Mac

Cuando usas un modelo GGUF, la inferencia se ejecuta completamente en el dispositivo. Las indicaciones, las respuestas y el historial de sesiones nunca tocan un servidor. El modo avión funciona.

Las claves API en el llavero

OpenRouter Las claves API se almacenan en el llavero macOS, no en archivos de configuración de texto sin formato. El mismo almacén de credenciales en el que confía su sistema para contraseñas y certificados.

Sin telemetría

Roundtable AI no envía análisis, datos de uso ni informes de fallos a HighRoad Software. No existe un sistema de cuentas. No hay píxeles de seguimiento.

Almacenamiento local de SQLite

Todos los datos de la sesión se almacenan en una base de datos SQLite local en su Mac. Exporte a Markdown, JSON, HTML o PDF en cualquier momento. Nada está sincronizado con la nube.

Primeros pasos

Primeros pasos con modelos locales

Tres pasos. Sin terminales. Sin pitón. Sin Docker.

1

Descargue un modelo GGUF

Vaya a Hugging Face y descargue un archivo .gguf. Buenos puntos de partida: Mistral 7B Instruct Q4_K_M (~4,1 GB), Llama 3 8B Q4_K_M (~4,7 GB), o Phi-3 Mini Q4 (~2,2 GB). ¿No estás seguro de cuál? Lea elegir un modelo local. Guárdelo en cualquier lugar de su Mac.

2

Apunte Roundtable AI hacia él

Abra Roundtable AI, vaya a Configuración → Modelos y agregue una conexión local GGUF. Seleccione su archivo .gguf. La aplicación valida el archivo, informa el uso de memoria estimado y lo carga en la GPU Metal.

3

Asígnalo a los agentes y listo

Crea una nueva sesión, elige tus personajes y asigna el modelo local a uno o más agentes. Mezclar con agentes OpenRouter o Ollama en la misma sesión. Presiona Inicio: los agentes comienzan a responder inmediatamente, token por token.

Preguntas frecuentes

Preguntas frecuentes

GGUF es un formato de archivo para modelos de lenguaje grandes cuantificados. Descarga un solo archivo (por ejemplo, de Hugging Face) y lo ejecuta localmente. Sin Python, sin Docker, sin gestión de dependencias. El formato admite diferentes niveles de cuantificación (Q4, Q5, Q8) que compensan la calidad del modelo por el uso de la memoria.
La memoria unificada de 16 GB es el mínimo práctico para sesiones de múltiples agentes con modelos locales. Con 16 GB puedes ejecutar dos modelos 3B simultáneamente. Con 32 GB, puedes acomodar de 3 a 4 agentes en modelos 7B como Mistral 7B o Llama 3 8B. Con 8 GB, la inferencia local es posible pero estricta: considere emparejar un agente local con agentes en la nube a través de OpenRouter.
No. La inferencia local GGUF se ejecuta completamente en el dispositivo. No salen datos de su Mac. Solo necesita Internet si utiliza OpenRouter modelos en la nube, e incluso entonces, solo para esos agentes específicos. Los agentes locales trabajan sin conexión, en un avión o con su firewall bloqueando todo el tráfico saliente.
Sí. Cada agente elige su propia fuente de modelo de forma independiente. Un agente puede ejecutar un Mistral 7B local mientras que otro usa GPT-4o a través de OpenRouter y un tercero usa una Llama 3 alojada en Ollama. Los tres se responden entre sí en la misma conversación y ven el mismo contexto compartido.
Roundtable AI detecta automáticamente una instancia Ollama en ejecución en su Mac. Cualquier modelo que hayas descargado a través de ollama pull está disponible de inmediato, sin configuración adicional. Seleccione un modelo Ollama y asígnelo a un agente de la misma manera que lo haría con un archivo GGUF o un modelo OpenRouter.

Pruebe la inferencia local hoy

Roundtable AI es gratuito en Mac App Store. Descargue un modelo GGUF, apunte la aplicación hacia él y ejecute su primera sesión multiagente local en menos de un minuto.

Descarga gratuita en Mac Más información sobre Roundtable AI