Arquitecturas de altísima calidad
Diseño de sistemas, límites de dominio, contratos entre servicios y trade-offs que aguantan producción. El plano antes del código — y el código que respeta el plano.
Serie Omega · Cerebro de Cerebros FRONTIER
El cerebro que dirige a los demás cerebros. Basado en GLM-5.3-Flash (zai-org/GLM-5.3-Flash · Z.ai) — multimodal nativo de ~320B con ~18B activos — y finetuneado por Xeretron. Compite con modelos Frontier: arquitecturas de altísima calidad, bugs imposibles, control de dispositivos y orquestación de agentes.
18 t/s: medición Xeretron en nodo con 2× RTX 3090. Varía por cuantización, contexto y reasoning_effort. Base se acerca a Claude Opus 4.8 en benches públicos de coding/agentic (Z.ai) — no es equivalencia garantizada en tu nodo.
Bondades Omega
No es un chat más grande. Es el modelo que diseña sistemas, dirige agentes y toca el mundo real.
Diseño de sistemas, límites de dominio, contratos entre servicios y trade-offs que aguantan producción. El plano antes del código — y el código que respeta el plano.
Fallos multi-capa, heisenbugs, estados que “no deberían existir”. Omega sostiene contexto largo (hasta 1M) y reasoning profundo hasta el root cause verificable.
UI de escritorio, terminales y entornos operativos: la base destaca en OSWorld y Terminal-Bench. Ideal para automatizar máquinas reales, no solo APIs.
Orquesta flotas de agentes, tools y MCPs con disciplina: Toolathlon, AutomationBench y Agents’ Last Exam en la referencia pública de la base.
Texto, imagen y video en el mismo loop — no un “vision bolt-on”. Lectura de documentos, charts, pantallas y evidencia visual en el razonamiento.
Hereda reasoning_effort: low, high, max (default max). Escalas pensamiento según la misión.
Ventana nativa de 1.048.576 tokens: repos enteros, traces largas, sesiones de agente de horas sin “perder el hilo” por scaling improvisado.
Herramientas, APIs y MCPs como ciudadanos de primera clase. Menos loops rotos; más llamadas correctas al servidor correcto.
Base bajo MIT de Z.AI: uso comercial, modificación y redistribución con NOTICE. El cerebro Frontier sin el laberinto de Community License.
Listo para investigación, operaciones matemáticas complejas y cálculo exigente. Encaja en universidades, colegios y labs: razonamiento profundo en local, sin mandar datos al cloud.
Titan 125B · rey de la perfección
Omega 320B · cerebro de cerebros
Base · GLM-5.3-Flash
Pesos open vía zai-org/GLM-5.3-Flash (Z.ai). Arquitectura y receta rediseñadas alrededor de capacidad y eficiencia: más inteligencia por compute, contexto largo barato, agentes que aguantan.
Primera vez en la serie GLM: corta el costo de servir contextos largos sin regalar precisión. Crítico para traces de agente y repos enormes.
mHC para escalar conexiones entre capas con más eficiencia — más capacidad útil sin inflar el costo de inferencia.
Inteligencia de frontera con activación selectiva: densidad de pensamiento sin pagar 320B densos en cada token.
Preentrenado en un corpus multimodal masivo: visión y texto no son “add-ons”, son el mismo cerebro.
Referencia de la base
Cifras de la model card / blog de Z.ai para GLM-5.3-Flash. Omega hereda esta base y la especializa al ecosistema Xeretron.
| Benchmark | GLM-5.2 | GLM-5.3-Flash (base Omega) | Opus 4.8* |
|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 84.3 | 85.0 |
| DeepSWE v1.1 | 46.2 | 63.4 | 58.0 |
| NL2Repo | 48.9 | 56.3 | 69.7 |
| Toolathlon Verified | 59.9 | 78.4 | 76.2 |
| AutomationBench | 26.2 | 48.8 | 41.0 |
| Agents’ Last Exam | 20.4 | 26.3 | 27.0 |
| HLE w/ tools | 54.7 | 55.3 | 57.9 |
| GDPval-AA v2 | 1504 | 1773 | 1582 |
| OSWorld 2.0 | — | 59.1 | 54.8 |
| OfficeQA Pro | — | 62.4 | 48.9 |
| CharXiv Reasoning | — | 89.4 | 89.9 |
| Chartography | — | 78.0 | 75.0 |
| Vision2Web | — | 77.8 | 76.1 |
| MMVU | — | 80.5 | 67.4 |
Fuente: Z.ai · GLM-5.3-Flash / model card. *Claude Opus 4.8 según la misma tabla del autor. Los harnesses son los declarados allí. Omega no sustituye una evaluación en tu hardware.
Especificaciones
| Atributo | Detalle |
|---|---|
| Nombre | Xeretron Omega 320B |
| Base | GLM-5.3-Flash · zai-org/GLM-5.3-Flash |
| Parámetros | ~320B / 321B total · ~18B activos por token (MoE) |
| Arquitectura | Atención híbrida sparse + linear · mHC · multimodal nativo |
| Contexto | 1.048.576 tokens nativo · salida recomendada hasta ~131K |
| Modalidades | Texto · imagen · video · tool / MCP / agentes |
| Inteligencia | reasoning_effort: low · high · max (default max) |
| Especialidad Xeretron | Cerebro de cerebros · arquitectura · bugs · dispositivos · agentes |
| Throughput local | Hasta ~18 t/s en 2× RTX 3090 (medición Xeretron; varía por cuantización/contexto) |
| Nodo de referencia | 2× RTX 3090 (24 GB c/u) · CPU 24 threads / 12 físicos · ~92 GB RAM sistema |
| Licencia base | MIT (Z.AI) — LICENSE / NOTICE |
Licencia · MIT
En tu nodo
Lo tenemos operando en infraestructura real: hasta 18 tokens/s con 2× RTX 3090 (24 GB VRAM c/u), CPU de 24 threads y ~92 GB de RAM de sistema. El nodo Xeretron dimensiona cuantización, contexto y lanes para que Omega sea usable — no solo “cargable”.
Siguiente paso
Omega para Frontier y orquestación. Titan para perfección de producto. Turbo para velocidad. Developer para el craft diario en CodiiX.