Arquitectura híbrida
40 capas · layout 10 × (3 × DeltaNet→MoE + 1 × Attention→MoE). Hidden 2048. Capacidad 35B con costo de ~3B activos.
Modelos · Serie Turbo
Modelo basado en Qwen3.6-35B-A3B-MTP y finetuneado por Xeretron: experto en arquitectura y DevOps, administra agentes de todo tipo y brilla con visión documental. Es el finetune más rápido que hemos hecho — hasta 200 t/s según GPU.
Para qué existe
Xeretron Turbo 35B es nuestro finetune más rápido: MoE con ~3B activos por token y MTP para empujar el throughput. Diseña arquitecturas, corre DevOps, orquesta agentes y lee documentos con visión — en tu infraestructura, sin contador de tokens.
Servicios, límites, datos, seguridad y despliegue: sistemas que se pueden operar, no solo dibujar.
Pipelines, infra como código, incidentes, runbooks y automatización con agentes locales.
Administra agentes de todo tipo: coding, ops, documentos y orquestación multi-herramienta.
Lee PDFs, capturas, formularios y diagramas; alimenta agentes con el contexto visual real.
Por qué Turbo
La base Qwen3.6-35B-A3B activa ~3B parámetros por token (de 35B totales) y trae Multi-Token Prediction. Sobre eso afinamos para arquitectura, DevOps y agentes: menos latencia percibida, más trabajo terminado por segundo en el nodo.
Base abierta · Qwen3.6-35B-A3B-MTP
Qwen3.6-35B-A3B (Alibaba / Qwen) es un MoE multimodal: 35B totales y ~3B activos por token, 256 expertos (8 routed + 1 shared), arquitectura híbrida Gated DeltaNet + atención, visión nativa y Multi-Token Prediction. Ideal para un finetune Turbo orientado a ops y agentes rápidos.
40 capas · layout 10 × (3 × DeltaNet→MoE + 1 × Attention→MoE). Hidden 2048. Capacidad 35B con costo de ~3B activos.
Thinking on by default en la familia Qwen3.6; profundidad ajustable para no quemar tokens de pensamiento cuando el job es ops.
Encoder visual integrado: PDFs, capturas, formularios, diagramas y tickets. El punto fuerte de Turbo en visión documental.
Tool calling y harnesses (vLLM / SGLang). Pensado para administrar flotas de agentes con feedback del entorno.
MTP multi-step: speculative decoding y más tokens/s cuando el runtime lo activa — la base de la serie Turbo.
Compatible con Transformers, vLLM, SGLang y el stack del nodo Xeretron. Apache 2.0 en la línea open del autor.
Finetune Xeretron
Sobre Qwen3.6-35B-A3B-MTP afinamos para arquitectura, DevOps, orquestación de agentes y lectura documental — con la agresividad de throughput que define a Turbo.
Especialización
Turbo 35B está sesgado a velocidad y operación: donde el agente debe terminar el trabajo ya.
Diseño de sistemas, trade-offs, contratos y límites. Turbo empuja decisiones de arquitectura que se pueden desplegar y operar.
De requisitos a pipelines: infra, CI/CD, incidentes y automatización. Menos “scripts sueltos”, más operación confiable.
Administra agentes de todo tipo: planificación, tool calling, feedback del entorno y tareas de largo horizonte — a velocidad Turbo.
Documentos, capturas y formularios como contexto de agente. La misma GPU que hace DevOps también lee el papel escaneado.
Referencia de la base · Qwen3.6-35B-A3B
Datos de la model card pública de Qwen3.6-35B-A3B. Xeretron Turbo 35B hereda esta base MoE+MTP y la especializa; las métricas de finetune (incl. t/s en tu GPU) se validan en el onboarding.
| Atributo (base) | Detalle | Qwen3.6-35B-A3B |
|---|---|---|
| Parámetros | Capacidad / costo por token | 35B total · ~3B activos |
| Experts | MoE routing | 256 · 8 routed + 1 shared |
| Capas | Híbrido DeltaNet + Attention | 40 |
| Contexto | Nativo / extendido | 262K · hasta ~1M (YaRN) |
| MTP | Speculative decoding | Entrenado multi-step |
| Modalidades | Texto + visión | Imagen / video / docs |
| Licencia | Línea open del autor | Apache 2.0 |
Fuente: model card pública de Qwen/Qwen3.6-35B-A3B. El “-MTP” en nuestro naming destaca el uso de Multi-Token Prediction en el stack Turbo. Los 200 t/s son mediciones Xeretron en hardware de alto rendimiento y dependen de GPU, cuantización y contexto.
Especificaciones
| Atributo | Detalle |
|---|---|
| Nombre | Xeretron Turbo 35B |
| Base | Qwen3.6-35B-A3B-MTP (MoE VLM · Apache 2.0 en la línea open del autor) |
| Parámetros | 35B totales · ~3B activos por token |
| Capas | 40 · layout 10 × (3 × DeltaNet→MoE + 1 × Attention→MoE) |
| Hidden / experts | 2048 · 256 experts · intermediate 512 |
| Vocabulario | ~248K tokens (padded) |
| Contexto | 262.144 nativo · hasta ~1.000.000 con YaRN / rope scaling |
| Modalidades | Texto + visión documental (imagen / video / PDF) · tool calling · MTP |
| Especialidad | Arquitectura · DevOps · Agentes · Visión documental |
| Runtime Xeretron | Panel + lanes GPU · API OpenAI-compatible · agentes |
| Despliegue | Nodos personales y de equipo (GPU NVIDIA / CUDA) |
Nodos personales
El MoE 35B-A3B está pensado para throughput: pocos parámetros activos por token + MTP. Con cuantización adecuada corre fuerte en workstations y servidores. El nodo Xeretron dimensiona VRAM, contexto y concurrencia contigo — los 200 t/s son el techo observado, no una garantía en cualquier GPU.
Carga el perfil Turbo, publica el endpoint interno y apunta tus agentes / CI al nodo. Métricas de primer token, tok/s y salud del modelo en la misma pantalla.
Ecosistema
Agentes y pipelines que no esperan: más t/s, más ciclos de corrección en el mismo día.
Hooks a CI, runbooks y orquestadores locales vía API OpenAI-compatible.
Código, prompts y documentos se quedan en tu infraestructura. Sin alquiler eterno de inteligencia.
Siguiente paso
Evaluamos tu GPU, el contexto y si Turbo o Developer encaja mejor. Si el hardware no alcanza los 200 t/s, te lo decimos con números reales.