Saltar al contenido principal

04 Job Monitoring

Job Monitoring responde primero si se hizo el trabajo y después ayuda a localizar dónde y cuándo se concentra el impacto batch.

Operations Job Monitoring con datos anonimizados
Dominio Job Monitoring con señales batch anonimizadas.

Qué aparece

PanelmetricId o datasetLectura
Failed jobs · Last 15 minfailed-jobsIncrementos de errores batch durante los 15 minutos anteriores al final del rango
Canceled jobs · Last 15 mincanceled-jobsEjecuciones únicas canceladas durante los 15 minutos anteriores al final del rango
Long-running jobs · Current · >120 minlong-running-jobsSnapshot actual de jobs en ejecución por encima de 120 minutos
Long-running work processes by serverlong-running-work-processesDuración CCMS en segundos, separada por servidor
Maximum long-running work processes (24 h)long-running-work-processesMáxima duración real en 24 horas por servidor; el donut sólo contiene servidores reales
Background work processesjob-metricsCapacidad NumberOfWpBTC por servidor, como línea escalonada
Background work-process errorsfailed-jobsIncrementos de ErrorsInWpBTC por servidor, como barras
Job RunsJobsTabla de ejecuciones y su detalle
Job EventsEventsEventos relacionados con jobs

Failed jobs no muestra directamente el contador acumulado de SAP ErrorsInWpBTC. SPOT deduplica cada observación por TID y calcula los incrementos positivos por servidor. Si el contador se reinicia, el valor nuevo es el incremento; si falta una muestra anterior reciente o el hueco supera 15 minutos, el resultado es UNKNOWN. Un cero sólo se muestra cuando existe cobertura válida.

Canceled jobs cuenta ejecuciones únicas en (to-15m, to]. Failed jobs usa el mismo final de rango: el KPI representa esa ventana móvil, mientras su gráfica conserva todo el rango solicitado. Si una ejecución tiene varias líneas coincidentes, SPOT usa la última como momento del resultado; no atribuye al pasado una cancelación cuya línea final sea posterior al corte elegido. El filtro de servidor se aplica a esa línea final: si un job se movió entre servidores, no se cuenta por una línea anterior del host seleccionado.

Long-running jobs usa snapshots XBP por servidor. El conector selecciona jobs SAP en estado R y cuenta sólo los que llevan más de 120 minutos: exactamente 120:00 queda fuera y 120:01 entra. Un cero fresco es una observación válida; UNKNOWN significa ausencia, error o pérdida de frescura. SPOT no utiliza Work Processes, datos de demostración ni un cero inventado como sustituto.

Long-running work processes es una señal de duración en segundos, no un recuento de procesos ni un sustituto de los jobs en ejecución.

Los tres resultados funcionales aparecen como KPI equivalentes. El detalle de Long-running work processes comparte composición con su máximo de 24 horas, en proporción 8/4. La composición Background processing by server mantiene dos gráficas separadas y sincronizadas: capacidad NumberOfWpBTC arriba y deltas de errores abajo. Comparten cursor temporal, leyenda y color por servidor, pero usan ejes enteros independientes desde cero. Cuando todos los deltas cubiertos son cero se indica explícitamente que no hubo errores; un bucket UNKNOWN impide mostrar ese mensaje. Job Runs y Job Events mantienen paneles propios; los dumps se investigan exclusivamente en Work Process.

En Job runs, un clic selecciona la fila y actualiza Execution summary. Pulsa Open details, usa Enter o haz doble clic para abrir una vista casi completa con lifecycle y job log paginado. Esc cierra el detalle y devuelve el foco a la fila. Open details es la acción primaria azul del resumen para que sea reconocible tanto en tema claro como oscuro. La tabla muestra 15 ejecuciones por página y traduce los códigos SAP a Planned, Released, Ready, Active, Finished y Canceled; API y storage conservan el código original.

Detalle de una ejecución batch anonimizada
Overlay de investigación con resumen, lifecycle y job log completo.

Interpretación

  • OK: no hay fallos o cancelaciones relevantes en el intervalo observado.
  • WARN: fallos repetidos, cancelaciones crecientes o presión batch concentrada en un servidor.
  • KO: impacto sostenido en trabajos críticos o degradación simultánea de jobs y capacidad batch.
  • UNKNOWN: falta una señal fresca. En Long-running jobs, revisa permisos XBP, zona horaria de la conexión y Agent logs.

Un 0 en Canceled jobs es válido cuando el intervalo ha sido observado sin cancelaciones mediante una consulta correcta. Si el Data Stream logs no está disponible o el productor no es schema v2, el resultado es UNKNOWN o producer_upgrade_required, no cero. En Long-running jobs, un 0 también es válido, pero sólo cuando procede de un snapshot XBP correcto. La misma ejecución no se cuenta varias veces por tener varias líneas de log.

Filtros y siguientes pantallas

Filtra por rango de ejecución, estado y servidor. Abre Job Runs para nombre, job count y log; usa Job Events para mensajes asociados. Cruza con Work Process para capacidad batch y dumps, DB para latencia y Filesystem si el job escribe spool, exportaciones o logs.

Uso operativo

Job Monitoring resume el resultado batch sin obligarte a entrar primero en la tabla completa. Los tres KPI funcionales también aparecen en Landing; el resto de paneles aporta el detalle por servidor y el historial.

Si hay fallos o cancelaciones repetidos por nombre, abre Job Runs para revisar cada ejecución y sus eventos. Si coinciden con DB request time alto o falta de procesos batch, cruza con DB y Work Process antes de atribuir el problema únicamente al job.