Serie Titan · Flagship de perfección

Xeretron Titan 125B

El rey de la perfección. Basado en Qwen3.8-Flash-Next — preview de la arquitectura rumbo a Qwen4 — y finetuneado por Xeretron. Inteligencia multiplicada frente al 27B: resuelve bugs infernales, controla MCPs con precisión, crea y manipula canvas y objetos 3D, y entrega desarrollos y landings con acabado fino.

Bugs infernales 3 niveles intel. Canvas · 3D MCP perfecto Acabados totales
Quiero Titan en mi nodo Ver todas las bondades
40 t/s hasta · 2× RTX 3090
125Bbackbone MoE
6Bactivos / token
51Bn-gram emb.
×10vs Developer 27B*
3niveles intel.

*Posicionamiento de producto Xeretron: profundidad y calidad de acabado percibidas frente a Developer 27B en tareas complejas (bugs, agentes, UI). No es un score de un bench único.

Bondades Titan

Donde los demás se traban, Titan termina.

No es “otro chat más grande”. Es el modelo que cierra el trabajo con calidad de producto.

Bugs infernales

Heisenbugs, condiciones de carrera, estados imposibles, refactors que rompen en el borde. Titan sostiene el hilo hasta el root cause y el fix verificable.

3 niveles de inteligencia

Hereda el control reasoning_effort: low, medium, xhigh. Escalas pensamiento según el ticket — no quemas profundidad cuando no hace falta.

Canvas & objetos 3D

Creación y manipulación de canvas, layouts interactivos y objetos 3D: ideación visual que se convierte en artefacto, no en párrafo.

MCPs bajo control

Tool calling y orquestación de MCP con disciplina: menos loops rotos, más llamadas correctas al servidor correcto, en el orden correcto.

Acabados completos

Desarrollos que llegan al borde: estados vacíos, errores, tipografía, responsivo, accesibilidad básica y “detalle de producto”, no solo el happy path.

Landings finas

Landing pages con atmósfera, jerarquía y micro-detalle. El tipo de UI que se siente diseñada, no generada a medias.

Developer 27B · precisión densa

El craft de CodiiX

  • 27B densos · vibe coding diario
  • Excelente relación calidad / VRAM
  • ~70 t/s según GPU
  • Ideal para iteración continua

Titan 125B · rey de la perfección

Cuando el listón sube ×10

  • 125B MoE · 6B activos + n-gram
  • Bugs duros · MCP · canvas · 3D
  • ~40 t/s en 2× RTX 3090
  • Ideal para entregas “sin remiendos”

Base · Qwen3.8-Flash-Next

Preview de la arquitectura rumbo a Qwen4.

Publicado como pesos open en la línea unsloth/Qwen3.8-Flash-Next (familia Qwen). No es “más de lo mismo”: introduce Qwen Sparse Attention, Gated Residual y N-gram Embedding para escalar inteligencia con eficiencia.

Qwen Sparse Attention

Atención a nivel de micro-bloques (no token a token). Menos latencia en contextos largos — crítico para agentes y sesiones de debug profundas.

Gated Residual

Residuales con gates de lectura/escritura: más expresividad entre capas sin inflar el costo de inferencia.

N-gram Embedding (51B)

Eje de parámetros offloadeable: escala capacidad sin el costo compute de un MoE equivalente. Ideal para nodos con memoria ajustada.

MoE 512 experts · MTP

10 routed + 1 shared activos · ~6B por token. MTP multi-step para empujar throughput cuando el runtime lo habilita.

Referencia de la base

Números públicos vs Qwen3.8-27B.

Cifras de la model card de Qwen3.8-Flash-Next. Titan hereda esta base y la especializa al ecosistema Xeretron; los t/s locales son mediciones propias.

Benchmark Qwen3.8-27B Flash-Next (base Titan)
DeepSWE 1.142.258.7
SWE-bench Pro61.762.5
SWE-bench Multilingual73.881.0
JobBench33.455.7
Toolathlon Verified67.173.5
GPQA Diamond89.291.7
LiveCodeBench v690.391.9
Vision2Web62.964.0
ClawEval-MM Pass@357.464.4

Fuente: model card pública de Qwen3.8-Flash-Next / Unsloth. Los harnesses son los declarados por el autor. Titan no sustituye una evaluación en tu hardware: medimos calidad y tok/s en el nodo real.

Especificaciones

Ficha técnica Titan.

AtributoDetalle
NombreXeretron Titan 125B
BaseQwen3.8-Flash-Next · unsloth/Qwen3.8-Flash-Next
Parámetros125B backbone · ~6B activos · +51B n-gram · +MTP (~4B)
Capas / MoE48 capas · 512 experts · 10 routed + 1 shared
ArquitecturaGated DeltaNet + Qwen Sparse Attention · Gated Residual
Contexto262.144 nativo · hasta ~1.000.000 (YaRN)
ModalidadesTexto · imagen · video · tool / MCP
Inteligencia3 niveles: low · medium · xhigh (reasoning_effort)
Especialidad XeretronPerfección de producto · bugs · canvas/3D · MCP · landings
Throughput localHasta ~40 t/s en 2× RTX 3090 (medición Xeretron; varía por cuantización/contexto)
Licencia baseQwen Community License 1.0 — ver salvedad de distribución

Licencia · Qwen Community 1.0

Cómo lo compartimos en Xeretron

Cumpliendo con la Qwen Community License 1.0 del modelo base (Qwen3.8-Flash-Next), Xeretron Titan 125B se comparte para el uso que el usuario quiera darle dentro de su nodo Xeretron. No cobramos por el modelo: lo que se evalúa o contrata es la infraestructura, el panel y el acompañamiento — no una licencia de pesos Titan.

  • Finetune / derivado entregado con NOTICE y aviso de licencia Qwen.
  • Uso en tu entorno: el destino del modelo lo define el usuario en su nodo.
  • No vendemos Titan como producto de pesos aparte ni como MaaS público de Qwen.
  • El usuario debe respetar la Qwen Community License 1.0 en su propio uso; si su caso es MaaS o AI Work Assistant comercial a escala, debe revisar los términos con Qwen.

En tu nodo

Corre en local. Probado con Xeretron usando dos GPU RTX 3090.

Lo tenemos operando en infraestructura real: hasta 40 tokens/s con 2× RTX 3090. El nodo Xeretron dimensiona cuantización, contexto y lanes para que Titan sea usable — no solo “cargable”.

  • Dual GPU consumer high-end como referencia práctica.
  • N-gram offload + MoE activo: más inteligencia por watt de atención.
  • API OpenAI-compatible para CodiiX, agentes y MCPs.
  • Evaluación previa: si tu VRAM no alcanza el perfil deseado, te lo decimos con números.

Stack recomendado

  • 2× RTX 3090 (o superior) · CUDA
  • Perfil Titan en el panel Xeretron
  • reasoning_effort según tarea
  • MCPs + CodiiX / agentes en el mismo nodo

Siguiente paso

Instala al rey. Quédate con la perfección.

Titan para cuando el entregable no puede verse “casi listo”. Turbo cuando necesitas velocidad. Developer cuando iteras todo el día en CodiiX.

El modelo se comparte bajo Qwen Community License 1.0 para el uso que el usuario quiera en su nodo; no cobramos por Titan. Salvedad de licencia.