Modelos · Serie Turbo

Xeretron Turbo 35B

Modelo basado en Qwen3.6-35B-A3B-MTP y finetuneado por Xeretron: experto en arquitectura y DevOps, administra agentes de todo tipo y brilla con visión documental. Es el finetune más rápido que hemos hecho — hasta 200 t/s según GPU.

Arquitectura DevOps Agentes Visión documental MTP · Turbo
Probar en mi nodo Ver especificaciones
200 t/s hasta · según GPU
35Btotal · MoE
3Bactivos / token
262Kcontexto nativo
MTPmulti-token pred.
VLvisión documental

Para qué existe

Velocidad de nodo. Cerebro de operaciones.

Xeretron Turbo 35B es nuestro finetune más rápido: MoE con ~3B activos por token y MTP para empujar el throughput. Diseña arquitecturas, corre DevOps, orquesta agentes y lee documentos con visión — en tu infraestructura, sin contador de tokens.

  • Especializado en arquitectura y DevOps de punta a punta.
  • Administra agentes de todo tipo: ops, docs, coding y orquestación.
  • Experto en visión documental: PDF, capturas, planos y tickets visuales.
  • El finetune más rápido que hemos sacado: hasta 200 t/s según GPU.

Arquitectura

Servicios, límites, datos, seguridad y despliegue: sistemas que se pueden operar, no solo dibujar.

DevOps

Pipelines, infra como código, incidentes, runbooks y automatización con agentes locales.

Agentes

Administra agentes de todo tipo: coding, ops, documentos y orquestación multi-herramienta.

Visión documental

Lee PDFs, capturas, formularios y diagramas; alimenta agentes con el contexto visual real.

Por qué Turbo

MoE + MTP = el finetune más rápido nuestro.

La base Qwen3.6-35B-A3B activa ~3B parámetros por token (de 35B totales) y trae Multi-Token Prediction. Sobre eso afinamos para arquitectura, DevOps y agentes: menos latencia percibida, más trabajo terminado por segundo en el nodo.

  • Hasta 200 t/s medidos en GPUs de alto rendimiento (varía por cuantización y contexto).
  • Ideal cuando el cuello de botella es velocidad de agente / CI / ops.
  • Complementa a Developer 27B: Turbo empuja throughput; Developer empuja profundidad de coding denso.

Serie Turbo vs Developer

  • Turbo 35B — MoE + MTP · arquitectura · DevOps · agentes · docs.
  • Developer 27B — denso · CodiiX · programación profunda.
  • Ambos corren en nodos Xeretron con API OpenAI-compatible.

Base abierta · Qwen3.6-35B-A3B-MTP

Partimos de un MoE open pensado para velocidad real.

Qwen3.6-35B-A3B (Alibaba / Qwen) es un MoE multimodal: 35B totales y ~3B activos por token, 256 expertos (8 routed + 1 shared), arquitectura híbrida Gated DeltaNet + atención, visión nativa y Multi-Token Prediction. Ideal para un finetune Turbo orientado a ops y agentes rápidos.

Arquitectura híbrida

40 capas · layout 10 × (3 × DeltaNet→MoE + 1 × Attention→MoE). Hidden 2048. Capacidad 35B con costo de ~3B activos.

Thinking control

Thinking on by default en la familia Qwen3.6; profundidad ajustable para no quemar tokens de pensamiento cuando el job es ops.

Visión nativa

Encoder visual integrado: PDFs, capturas, formularios, diagramas y tickets. El punto fuerte de Turbo en visión documental.

Tool calling

Tool calling y harnesses (vLLM / SGLang). Pensado para administrar flotas de agentes con feedback del entorno.

MTP

MTP multi-step: speculative decoding y más tokens/s cuando el runtime lo activa — la base de la serie Turbo.

Despliegue local

Compatible con Transformers, vLLM, SGLang y el stack del nodo Xeretron. Apache 2.0 en la línea open del autor.

Finetune Xeretron

De MoE open a turbo del ecosistema.

Sobre Qwen3.6-35B-A3B-MTP afinamos para arquitectura, DevOps, orquestación de agentes y lectura documental — con la agresividad de throughput que define a Turbo.

Qué aporta el finetune

  • Preferencia por runbooks, pipelines y decisiones de arquitectura accionables.
  • Mejor alineación con agentes de todo tipo, tool use y operaciones.
  • Español técnico claro + inglés de infra/código sin fricción.
  • Enfoque Arquitectura + DevOps: del ticket al deploy, del incidente al postmortem.
  • Optimizado para nodos personales y de equipo donde la velocidad importa.

Especialización

Cuatro frentes. Un solo Turbo.

Turbo 35B está sesgado a velocidad y operación: donde el agente debe terminar el trabajo ya.

Arquitectura

Diseño de sistemas, trade-offs, contratos y límites. Turbo empuja decisiones de arquitectura que se pueden desplegar y operar.

DevOps

De requisitos a pipelines: infra, CI/CD, incidentes y automatización. Menos “scripts sueltos”, más operación confiable.

Agentes

Administra agentes de todo tipo: planificación, tool calling, feedback del entorno y tareas de largo horizonte — a velocidad Turbo.

Visión documental

Documentos, capturas y formularios como contexto de agente. La misma GPU que hace DevOps también lee el papel escaneado.

Referencia de la base · Qwen3.6-35B-A3B

Qué aporta el Work original.

Datos de la model card pública de Qwen3.6-35B-A3B. Xeretron Turbo 35B hereda esta base MoE+MTP y la especializa; las métricas de finetune (incl. t/s en tu GPU) se validan en el onboarding.

Atributo (base) Detalle Qwen3.6-35B-A3B
ParámetrosCapacidad / costo por token35B total · ~3B activos
ExpertsMoE routing256 · 8 routed + 1 shared
CapasHíbrido DeltaNet + Attention40
ContextoNativo / extendido262K · hasta ~1M (YaRN)
MTPSpeculative decodingEntrenado multi-step
ModalidadesTexto + visiónImagen / video / docs
LicenciaLínea open del autorApache 2.0

Fuente: model card pública de Qwen/Qwen3.6-35B-A3B. El “-MTP” en nuestro naming destaca el uso de Multi-Token Prediction en el stack Turbo. Los 200 t/s son mediciones Xeretron en hardware de alto rendimiento y dependen de GPU, cuantización y contexto.

Especificaciones

Ficha técnica.

AtributoDetalle
NombreXeretron Turbo 35B
BaseQwen3.6-35B-A3B-MTP (MoE VLM · Apache 2.0 en la línea open del autor)
Parámetros35B totales · ~3B activos por token
Capas40 · layout 10 × (3 × DeltaNet→MoE + 1 × Attention→MoE)
Hidden / experts2048 · 256 experts · intermediate 512
Vocabulario~248K tokens (padded)
Contexto262.144 nativo · hasta ~1.000.000 con YaRN / rope scaling
ModalidadesTexto + visión documental (imagen / video / PDF) · tool calling · MTP
EspecialidadArquitectura · DevOps · Agentes · Visión documental
Runtime XeretronPanel + lanes GPU · API OpenAI-compatible · agentes
DespliegueNodos personales y de equipo (GPU NVIDIA / CUDA)

Nodos personales

Rápido en hardware real, no solo en benches.

El MoE 35B-A3B está pensado para throughput: pocos parámetros activos por token + MTP. Con cuantización adecuada corre fuerte en workstations y servidores. El nodo Xeretron dimensiona VRAM, contexto y concurrencia contigo — los 200 t/s son el techo observado, no una garantía en cualquier GPU.

  • Orientativo: GPU de consumo alto / workstation con VRAM suficiente para el cuantizado elegido.
  • Contexto largo (128K+) recomendado para preservar thinking en tareas complejas.
  • Lanes del panel para aislar agentes DevOps, visión documental y cargas de fondo.
  • Offline con pesos instalados; actualizaciones cuando tú lo decidas.

En el panel Xeretron

Carga el perfil Turbo, publica el endpoint interno y apunta tus agentes / CI al nodo. Métricas de primer token, tok/s y salud del modelo en la misma pantalla.

Ecosistema

No es solo un peso. Es velocidad operativa.

Throughput

Agentes y pipelines que no esperan: más t/s, más ciclos de corrección en el mismo día.

DevOps & agentes

Hooks a CI, runbooks y orquestadores locales vía API OpenAI-compatible.

Privacidad

Código, prompts y documentos se quedan en tu infraestructura. Sin alquiler eterno de inteligencia.

Siguiente paso

Pon Turbo 35B en tu nodo.

Evaluamos tu GPU, el contexto y si Turbo o Developer encaja mejor. Si el hardware no alcanza los 200 t/s, te lo decimos con números reales.