Serie Omega · Cerebro de Cerebros FRONTIER

Xeretron Omega 320B

El cerebro que dirige a los demás cerebros. Basado en GLM-5.3-Flash (zai-org/GLM-5.3-Flash · Z.ai) — multimodal nativo de ~320B con ~18B activos — y finetuneado por Xeretron. Compite con modelos Frontier: arquitecturas de altísima calidad, bugs imposibles, control de dispositivos y orquestación de agentes.

FRONTIER Arquitectura ×10 Bugs imposibles Dispositivos Control de agentes
Quiero Omega en mi nodo Ver todas las bondades
18 t/s hasta · 2× RTX 3090
320BMoE total
18Bactivos / token
1Mcontexto nativo
MITlicencia base
3reasoning levels

18 t/s: medición Xeretron en nodo con 2× RTX 3090. Varía por cuantización, contexto y reasoning_effort. Base se acerca a Claude Opus 4.8 en benches públicos de coding/agentic (Z.ai) — no es equivalencia garantizada en tu nodo.

Bondades Omega

Cuando el problema es de frontera, Omega piensa.

No es un chat más grande. Es el modelo que diseña sistemas, dirige agentes y toca el mundo real.

Arquitecturas de altísima calidad

Diseño de sistemas, límites de dominio, contratos entre servicios y trade-offs que aguantan producción. El plano antes del código — y el código que respeta el plano.

Bugs imposibles

Fallos multi-capa, heisenbugs, estados que “no deberían existir”. Omega sostiene contexto largo (hasta 1M) y reasoning profundo hasta el root cause verificable.

Control de dispositivos

UI de escritorio, terminales y entornos operativos: la base destaca en OSWorld y Terminal-Bench. Ideal para automatizar máquinas reales, no solo APIs.

Control de agentes

Orquesta flotas de agentes, tools y MCPs con disciplina: Toolathlon, AutomationBench y Agents’ Last Exam en la referencia pública de la base.

Multimodal nativo

Texto, imagen y video en el mismo loop — no un “vision bolt-on”. Lectura de documentos, charts, pantallas y evidencia visual en el razonamiento.

3 niveles de inteligencia

Hereda reasoning_effort: low, high, max (default max). Escalas pensamiento según la misión.

Contexto 1M nativo

Ventana nativa de 1.048.576 tokens: repos enteros, traces largas, sesiones de agente de horas sin “perder el hilo” por scaling improvisado.

Tool calling & MCP

Herramientas, APIs y MCPs como ciudadanos de primera clase. Menos loops rotos; más llamadas correctas al servidor correcto.

Licencia MIT

Base bajo MIT de Z.AI: uso comercial, modificación y redistribución con NOTICE. El cerebro Frontier sin el laberinto de Community License.

Investigación, cálculo y academia

Listo para investigación, operaciones matemáticas complejas y cálculo exigente. Encaja en universidades, colegios y labs: razonamiento profundo en local, sin mandar datos al cloud.

Titan 125B · rey de la perfección

Acabado de producto

  • 125B · 6B activos · Qwen Flash-Next
  • Canvas, landings, MCP fino
  • ~40 t/s en 2× RTX 3090
  • Ideal para entregas “sin remiendos”

Omega 320B · cerebro de cerebros

Cuando el listón es Frontier

  • 320B · 18B activos · GLM-5.3-Flash
  • Arquitectura · agentes · dispositivos
  • ~18 t/s en 2× RTX 3090 · MIT
  • Ideal para dirigir flotas y sistemas

Base · GLM-5.3-Flash

Primera multimodal nativa de la serie GLM-5.

Pesos open vía zai-org/GLM-5.3-Flash (Z.ai). Arquitectura y receta rediseñadas alrededor de capacidad y eficiencia: más inteligencia por compute, contexto largo barato, agentes que aguantan.

Atención híbrida sparse + linear

Primera vez en la serie GLM: corta el costo de servir contextos largos sin regalar precisión. Crítico para traces de agente y repos enormes.

Manifold-Constrained Hyper-Connections

mHC para escalar conexiones entre capas con más eficiencia — más capacidad útil sin inflar el costo de inferencia.

MoE ~320B · 18B activos

Inteligencia de frontera con activación selectiva: densidad de pensamiento sin pagar 320B densos en cada token.

Corpus multimodal ~30T

Preentrenado en un corpus multimodal masivo: visión y texto no son “add-ons”, son el mismo cerebro.

Referencia de la base

Números públicos: cerca de Frontier.

Cifras de la model card / blog de Z.ai para GLM-5.3-Flash. Omega hereda esta base y la especializa al ecosistema Xeretron.

Benchmark GLM-5.2 GLM-5.3-Flash (base Omega) Opus 4.8*
Terminal-Bench 2.181.084.385.0
DeepSWE v1.146.263.458.0
NL2Repo48.956.369.7
Toolathlon Verified59.978.476.2
AutomationBench26.248.841.0
Agents’ Last Exam20.426.327.0
HLE w/ tools54.755.357.9
GDPval-AA v2150417731582
OSWorld 2.0—59.154.8
OfficeQA Pro—62.448.9
CharXiv Reasoning—89.489.9
Chartography—78.075.0
Vision2Web—77.876.1
MMVU—80.567.4

Fuente: Z.ai · GLM-5.3-Flash / model card. *Claude Opus 4.8 según la misma tabla del autor. Los harnesses son los declarados allí. Omega no sustituye una evaluación en tu hardware.

Especificaciones

Ficha técnica Omega.

AtributoDetalle
NombreXeretron Omega 320B
BaseGLM-5.3-Flash · zai-org/GLM-5.3-Flash
Parámetros~320B / 321B total · ~18B activos por token (MoE)
ArquitecturaAtención híbrida sparse + linear · mHC · multimodal nativo
Contexto1.048.576 tokens nativo · salida recomendada hasta ~131K
ModalidadesTexto · imagen · video · tool / MCP / agentes
Inteligenciareasoning_effort: low · high · max (default max)
Especialidad XeretronCerebro de cerebros · arquitectura · bugs · dispositivos · agentes
Throughput localHasta ~18 t/s en 2× RTX 3090 (medición Xeretron; varía por cuantización/contexto)
Nodo de referencia2× RTX 3090 (24 GB c/u) · CPU 24 threads / 12 físicos · ~92 GB RAM sistema
Licencia baseMIT (Z.AI) — LICENSE / NOTICE

Licencia · MIT

LICENSE MIT NOTICE Omega

En tu nodo

Corre en local. Probado con Xeretron usando dos GPU RTX 3090.

Lo tenemos operando en infraestructura real: hasta 18 tokens/s con 2× RTX 3090 (24 GB VRAM c/u), CPU de 24 threads y ~92 GB de RAM de sistema. El nodo Xeretron dimensiona cuantización, contexto y lanes para que Omega sea usable — no solo “cargable”.

  • Dual RTX 3090 como referencia práctica Frontier.
  • ~48 GB VRAM total + RAM de sistema para offload.
  • API OpenAI-compatible para CodiiX, agentes y MCPs.
  • Evaluación previa: si tu perfil no alcanza, te lo decimos con números.

Nodo de referencia Xeretron

  • GPU 0 · RTX 3090 · 24 GB · hasta 330 W
  • GPU 1 · RTX 3090 · 24 GB · hasta 240 W
  • CPU 24 threads (12 físicos) · ~92 GB RAM
  • Hasta ~18 t/s · perfil Omega en el panel

Siguiente paso

Instala el cerebro de cerebros.

Omega para Frontier y orquestación. Titan para perfección de producto. Turbo para velocidad. Developer para el craft diario en CodiiX.