- La entrada de video de Ox Alpha admite video junto con indicaciones de texto e imagen mediante su API multimodal.
- Mejor vía de acceso: OpenRouter ofrece el modelo con el identificador
stealth/ox-alpha. - Ventana de contexto: La capacidad de contexto indicada es de 1 millón de tokens para flujos de trabajo extensos.
- Formato de salida: Ox Alpha acepta contexto visual y devuelve respuestas basadas en texto.
- Prioridad de las pruebas: Comienza con clips cortos y bien descritos antes de pasar a medios de producción más largos.
Entrada de video de Ox Alpha: modalidades compatibles y finalidad
Ox Alpha es un modelo de razonamiento anónimo centrado en la programación, el trabajo agéntico prolongado, las cargas de trabajo de producción y los flujos que combinan texto con contexto visual. Por ello, la entrada de video de Ox Alpha debe entenderse principalmente como una capacidad de análisis visual, no como una función de generación de video.
OpenRouter indica que el modelo acepta texto, imágenes y video, y devuelve texto. Esto lo hace adecuado para tareas como revisar una grabación de pantalla, identificar eventos en una demostración, explicar un flujo de trabajo visual o relacionar observaciones de un video con una indicación de ingeniería de software.
Aspectos destacados del video:
- Se indica un contexto de 1 millón de tokens para tareas de larga duración.
- La compatibilidad con video se presenta junto con la entrada de imágenes y texto.
- El modelo está orientado a flujos de programación y trabajo agéntico.
- No debe darse por hecho que admite audio solo porque admite video.
- La identidad del proveedor permanece sin revelar durante el periodo de vista previa.
La distinción práctica es importante: un modelo puede inspeccionar fotogramas visuales sin ofrecer necesariamente transcripción de voz ni razonamiento sobre audio. Las pruebas comentadas por la comunidad indican que Ox Alpha rechaza la entrada de audio, por lo que los usuarios deben tratar un archivo de video como una fuente visual, a menos que la documentación actual de la API confirme explícitamente la compatibilidad con audio.
| Capacidad | Indicación actual | Uso práctico |
|---|---|---|
| Entrada de texto | Compatible | Instrucciones, preguntas, código y criterios de análisis |
| Entrada de imagen | Compatible | Capturas de pantalla, diagramas, estados de la interfaz e imágenes de referencia |
| Entrada de video | Compatible | Análisis de eventos visuales y revisión de flujos de trabajo |
| Entrada de audio | No confirmada; las pruebas de la comunidad informan de su rechazo | Usa un paso de transcripción independiente cuando sea necesario |
| Salida de texto | Compatible | Explicaciones, resúmenes, código y hallazgos estructurados |
Trata el video como una secuencia de evidencias visuales. Si tu tarea depende de diálogos, música o efectos de sonido, transcribe el audio por separado e incluye la transcripción en la solicitud.
Cómo configurar la entrada de video de Ox Alpha
OpenRouter ofrece una ruta de API compatible con OpenAI para Ox Alpha. El slug del modelo es stealth/ox-alpha, y la página del proveedor muestra un proveedor alojado directamente durante la vista previa. El patrón de configuración resultará familiar si tu aplicación ya utiliza un cliente con estilo OpenAI.
El flujo de trabajo básico consta de cuatro partes:
Crea una clave de API de OpenRouter
Genera una clave de API desde el panel de OpenRouter y guárdala como variable de entorno. Evita colocar la clave directamente en el código del navegador, repositorios públicos o aplicaciones del lado del cliente.
Selecciona el slug del modelo Ox Alpha
Establece el campo del modelo en stealth/ox-alpha. Usar el slug exacto evita solicitudes accidentales a un modelo con un nombre similar o a un proveedor no relacionado.
Crea un mensaje multimodal
Incluye una instrucción de texto clara y adjunta el contenido de imagen o video mediante la estructura de solicitud multimodal compatible con tu SDK. Solicita un resultado definido, como marcas de tiempo, hallazgos o un resumen conciso.
Transmite o recopila la respuesta
Usa la transmisión cuando la aplicación se beneficie de una salida progresiva. En flujos automatizados, recopila la respuesta y valida su formato antes de enviarla a otra herramienta o sistema de almacenamiento.
Un patrón mínimo en TypeScript puede seguir la estructura del SDK de OpenRouter:
import { OpenRouter } from "@openrouter/sdk";
const openrouter = new OpenRouter({
apiKey: process.env.OPENROUTER_API_KEY
});
const response = await openrouter.chat.send({
model: "stealth/ox-alpha",
messages: [
{
role: "user",
content: [
{
type: "text",
text: "Review this video and list the major visual events in chronological order."
},
{
type: "video_url",
video_url: {
url: "YOUR_VIDEO_URL"
}
}
]
}
]
});
console.log(response.choices[0].message.content);
La sintaxis exacta de los archivos adjuntos puede variar según la implementación del SDK. Confirma el formato actual de la solicitud en la página del modelo Ox Alpha de OpenRouter antes de implementar una integración.
| Elemento de la solicitud | Valor recomendado | Por qué es importante |
|---|---|---|
model | stealth/ox-alpha | Dirige la solicitud a Ox Alpha |
| Instrucción de texto | Tarea específica y formato de salida | Reduce las respuestas vagas o incompletas |
video_url | URL de video accesible | Proporciona al proveedor una fuente visual recuperable |
stream | true para aplicaciones interactivas | Muestra la salida progresivamente |
max_tokens | Ajústalo según la longitud esperada de la respuesta | Controla el tamaño de la respuesta |
temperature | Comienza cerca del valor predeterminado documentado | Conserva una línea base predecible |
La página del proveedor indica que las indicaciones y las respuestas son conservadas por el proveedor externo y no se utilizan para entrenar el modelo. No subas imágenes confidenciales hasta que tu organización haya revisado los Términos del modelo de Stealth y los requisitos aplicables de gestión de datos.
Patrones de indicaciones de video que funcionan bien
El análisis de video mejora cuando la solicitud define qué se debe inspeccionar y cómo presentar el resultado. Una instrucción amplia como “Explica este video” puede producir un resumen general, mientras que una indicación estructurada puede solicitar límites de eventos, objetos visibles, cambios en la interfaz u observaciones relacionadas con el código.
Usa los siguientes patrones como puntos de partida:
Revisión cronológica
Solicita los eventos principales en orden, con marcas de tiempo aproximadas y una breve explicación de cada transición.
Auditoría de la interfaz y el flujo de trabajo
Pide cambios visibles en la interfaz, pasos de navegación, estados de error y acciones que deban reproducirse.
Contexto de programación
Combina una grabación de pantalla con el código fuente o una descripción del error y pide al modelo que relacione el comportamiento visible con las áreas probables de implementación.
Extracción estructurada
Define un esquema similar a JSON para objetos, acciones, marcas de tiempo, notas de confianza y observaciones sin resolver.
Una indicación fiable suele incluir cinco detalles:
- Alcance: Indica si el modelo debe inspeccionar todo el clip o solo determinadas secciones.
- Evidencia: Pídele que separe los hechos visibles de la interpretación.
- Tiempo: Solicita marcas de tiempo aproximadas cuando el orden de los eventos sea importante.
- Salida: Especifica viñetas, una tabla, JSON u otro formato.
- Incertidumbre: Exige que marque los fotogramas poco claros en lugar de presentar suposiciones como hechos confirmados.
| Objetivo de la indicación | Instrucción útil | Salida esperada |
|---|---|---|
| Resumen | “Resume los eventos visuales en orden cronológico.” | Lista ordenada de eventos |
| Revisión de errores | “Identifica los errores visibles y describe el estado de la pantalla cuando aparece cada uno.” | Tabla de problemas |
| Índice de tutorial | “Marca cada acción principal con una marca de tiempo aproximada.” | Marcadores de capítulos |
| Seguimiento de objetos | “Enumera los objetos que aparecen, desaparecen o cambian de posición.” | Cronología de objetos |
| Asistencia con código | “Relaciona el comportamiento visible con el contexto de código proporcionado, separando la evidencia de las hipótesis.” | Notas de diagnóstico |
Los clips largos deben dividirse en segmentos lógicos cuando la tarea requiera una revisión detallada fotograma a fotograma. La segmentación también facilita volver a intentar una solicitud fallida y comparar la interpretación del modelo entre distintas partes de la misma grabación.
Solicita explícitamente la evidencia y la incertidumbre. Una respuesta que distinga entre “visible en pantalla” y “explicación probable” resulta más útil que una narración sin matices.
Rendimiento, contexto y consideraciones de la vista previa
OpenRouter indica que Ox Alpha cuenta con un contexto de 1 millón de tokens y un precio gratuito en el momento de la referencia proporcionada del 2026-08-22. La misma página informa de una latencia P50 del proveedor de 5.30 segundos y un rendimiento de 23 tokens por segundo en sus mediciones mostradas. Estos valores son instantáneas operativas, no garantías para todas las ubicaciones, tamaños de solicitud o cargas de trabajo.
El modelo se presenta como adecuado para ingeniería de software de larga duración y cargas de trabajo de producción, pero el análisis de video sigue dependiendo de la accesibilidad del medio, la claridad visual, la calidad de la indicación y la implementación actual del proveedor.
| Métrica o estado | Valor o estado indicado | Interpretación |
|---|---|---|
| Contexto | 1M tokens | Gran capacidad para texto extenso y flujos de trabajo multimodales |
| Precio de entrada indicado | $0 por millón de tokens | Precio gratuito mostrado en la página de OpenRouter proporcionada |
| Precio de salida indicado | $0 por millón de tokens | Precio gratuito mostrado durante la vista previa |
| Fecha de lanzamiento | 20 de agosto de 2026 | Fecha actual de la ficha del modelo |
| Latencia P50 del proveedor | 5.30 segundos | Medición mostrada de latencia de ida y vuelta |
| Rendimiento P50 del proveedor | 23 tokens por segundo | Medición mostrada de generación |
| Disponibilidad del proveedor | 99.51% durante tres días | Instantánea mostrada en la página de referencia |
El estado del proveedor anónimo es fundamental para interpretar Ox Alpha. OpenRouter dirige las solicitudes al modelo, pero afirma que no es su desarrollador, propietario ni proveedor. Los análisis de la comunidad han sugerido vínculos con un sistema multimodal de la familia GLM basándose en huellas del tokenizador y del codificador de video, pero esto sigue siendo especulación hasta que se produzca una revelación oficial.
El periodo de vista previa también implica que la disponibilidad y los precios pueden cambiar. El flujo de trabajo más seguro consiste en supervisar la página del modelo, mantener disponible un proveedor o modelo alternativo y evitar diseñar una canalización crítica de producción en torno a una condición de acceso temporal.
Antes de enviar un video:
- Confirma que el slug actual del modelo sea stealth/ox-alpha
- Comprueba que la URL del video sea accesible para el proveedor de la API
- Elimina las imágenes confidenciales o innecesarias
- Escribe una indicación centrada con un formato de salida definido
- Prepara un plan alternativo para cambios en la vista previa o fallos de solicitudes
Los precios, el tiempo de actividad, la latencia y el comportamiento del proveedor pueden cambiar después de la vista previa. Vuelve a comprobar la ficha activa de OpenRouter el 2026-08-22 o antes de cada lanzamiento a producción.
Preguntas frecuentes sobre la entrada de video de Ox Alpha
Q: ¿Ox Alpha admite entrada de video?
Sí. La ficha de OpenRouter proporcionada describe Ox Alpha como un modelo que acepta texto, imágenes y video, y devuelve texto. Usa un mensaje multimodal con un archivo de video adjunto y una tarea de análisis claramente definida.
Q: ¿Puede Ox Alpha entender el audio dentro de un video?
La ficha proporcionada no confirma la compatibilidad con audio, y las pruebas de la comunidad indican que Ox Alpha rechaza la entrada de audio. Para tareas que dependan del audio, crea una transcripción por separado e inclúyela como texto.
Q: ¿Cuál es el nombre correcto del modelo en la API?
El identificador del modelo en OpenRouter es `stealth/ox-alpha`. Usa la documentación actual de OpenRouter para verificar el esquema de la solicitud y el formato de los archivos adjuntos antes de lanzar una integración.
Q: ¿Es gratuito usar Ox Alpha?
La página de OpenRouter proporcionada muestra precios de entrada y salida de cero durante la vista previa de 2026. Considéralo un precio actual de la ficha, no una promesa permanente, y revisa la página activa por si se producen cambios.
Ox Alpha funciona mejor cuando el video se trata como contexto visual estructurado para el razonamiento, la asistencia con código y el análisis de flujos de trabajo. Mantén las indicaciones específicas, separa la evidencia de las suposiciones y valida las conclusiones importantes antes de actuar sobre ellas.
Para obtener resultados fiables, combina clips cortos o segmentados con instrucciones precisas, solicitudes de marcas de tiempo y una política explícita sobre la incertidumbre.