Reading Time: 14 minutes

Comida clave

  • Visualización in situ procesa datos en memoria durante la simulación; Postprocessing guarda los datos sin procesar en el disco y luego los vuelve a leer para el análisis.
  • El in situ puede reducir el consumo total de energía ~43% eliminando el tiempo de inactividad del sistema, no solo sobre la sobrecarga de E/S.
  • In-Situ sirve como un sistema de alerta temprana para la divergencia numérica, la inestabilidad y las anomalías antes de perder las horas centrales.
  • La Estrategia híbrida (Reducción in situ → Ahorro selectivo → Posprocesamiento en datos reducidos) es el estándar moderno para los flujos de trabajo de HPC.
  • El postprocesamiento todavía gana para las necesidades de análisis exploratorio, pequeños conjuntos de datos y archival/re-analysis.
  • Su elección debe ir más allá del «tamaño de datos»: considere la suficiencia de E/S, la cuota de almacenamiento, la resolución temporal, la previsibilidad del análisis, la contención de recursos y las necesidades de archivo.

Introduccion

Cuando ejecuta una simulación, ya sea un caso de dinámica de fluidos computacional (CFD), un modelo de campo de fase o una ejecución de dinámica molecular, eventualmente necesita visualizar los resultados. Tiene dos estrategias principales: Visualización in situ, donde analiza los datos mientras la simulación aún se está ejecutando, o Procesamiento posterior, donde guarda el conjunto de datos completo en el disco y luego lo analiza.

Elegir entre ellos no es solo un detalle técnico: afecta el rendimiento de su simulación, el consumo de energía, la capacidad de depuración y la flexibilidad que tiene para el análisis futuro. La mayoría de los investigadores se encuentran con esta decisión al principio de su carrera de HPC y toman una decisión basada en la intuición o en la convención del equipo en lugar de un marco estructurado.

Para obtener una cobertura técnica profunda de la infraestructura, herramientas y patrones de implementación in situ, consulte nuestra guía de visualización in situ. Aquí, estamos tomando un ángulo diferente: un marco de decisión práctico que responde «¿Cuándo debo usar cada enfoque?» e introduce dos dimensiones que la mayoría de los artículos de comparación fallan: el argumento del ahorro de energía y el caso de uso de depuración.


La comparación clásica

Antes de sumergirnos en las nuevas dimensiones, establezcamos la diferencia de referencia entre los dos enfoques, ya que esta comparación fundacional ya está bien cubierta en nuestra guía de visualización in situ.

Visualización in situ Ejecuta el código de visualización y análisis en el mismo espacio de memoria que tu simulación. Los datos nunca tocan el disco: fluyen desde el solucionador de simulación directamente a una canalización de visualización. Esto elimina la E/S de archivo por completo para la ruta de visualización.

Post-Processing funciona de manera opuesta. Su simulación escribe conjuntos de datos completos en el disco a intervalos regulares (o en hitos de convergencia). Después de que se completa la simulación, carga esos archivos en una herramienta de visualización separada (paraView, Visit o similar) y explora los datos de forma interactiva.

La compensación clásica es simple:

Dimensión in-situ postprocesamiento
Lugar de datos en memoria durante la simulación Guardado en disco
Impacto de E/S Cero para la ruta de visualización Conjunto de datos completo escrito varias veces
Sincronización Tiempo real durante la simulación Después de que se completa la simulación
flexibilidad de análisis Solo canalizaciones predefinidas interactivo, exploratorio
Contención de recursos Calcular acciones con simulación Se ejecuta en hardware separado

Esta comparación ha sido bien documentada por Moreland (2016) en «Las tensiones de la visualización in situ», que establece las compensaciones fundamentales en torno a la contención de recursos, la pérdida de datos y la complejidad del acoplamiento. Nuestra guía de visualización in situ recorre los patrones de implementación, las comparaciones de herramientas y las estrategias de integración en profundidad.

Sin embargo, la decisión no es obvia solo en esta tabla. Aquí es donde las cosas se ponen interesantes.


La dimensión de energía y verdor

Esta es la idea de la mayoría de los artículos en este espacio Miss. La visualización in situ no solo acelera su flujo de trabajo, sino que reduce significativamente el consumo de energía y los ahorros son mayores de lo que cabría esperar.

de donde provienen los ahorros de energía

Múltiples estudios de Virginia Tech (en particular Adhinarayanan et al. 2015 y el estudio de caracterización de seguimiento en 2017) midieron el poder y la energía de las tuberías de visualización y encontraron que los enfoques in situ consumen aproximadamente un 43% menos total energía que los flujos de trabajo tradicionales de procesamiento posterior.

Aquí está el detalle crítico que la mayoría de las fuentes no explican claramente: la mayoría de estos ahorros no provienen de evitar las escrituras de E/S. Vienen de eliminando el tiempo de inactividad del sistema.

Cuando ejecuta el procesamiento posterior en un sistema HPC, los nodos de cálculo finalizan su simulación y se quedan inactivos mientras el subsistema de almacenamiento procesa los datos volcados. Esos nodos inactivos aún generan poder, potencia potencialmente significativa, sin hacer nada productivo. La visualización in situ evita esto por completo porque el análisis ocurre simultáneamente con el cálculo, manteniendo todos los nodos funcionando.

El estudio «In situ basado en imágenes» consciente de la energía (2024) amplía aún más este análisis, mostrando que las opciones de parámetros de representación dentro de los flujos de trabajo in situ afectan el consumo de energía. La selección de algoritmos de renderizado eficientes, por ejemplo, el procesamiento de volumen basado en partículas optimizado en lugar de una fundición de rayos pesados, genera un ahorro de energía adicional. La elección «verde» es importante incluso dentro de las tuberías in situ.

Por qué es importante esto para su flujo de trabajo

Si está ejecutando simulaciones en recursos compartidos de HPC, el consumo de energía afecta directamente a:

  • Tiempo de reloj de pared — Las simulaciones más rápidas se completan antes, reduciendo el tiempo de cálculo desperdiciado
  • Asignación de recursos — Muchos centros de HPC asignan tiempo en función de las horas de nodo consumidas
  • Impacto ambiental — Las grandes simulaciones pueden consumir megavatios-horas de energía

Para los PIS que gestionan los presupuestos de subvenciones y los administradores de HPC que evalúan la utilización de recursos, el argumento Energy es una razón legítima para considerar in situ incluso cuando los tamaños de datos son manejables.

Lo que recomendamos: si su simulación supera unos pocos gigabytes de producción por ejecución, los ahorros de energía por sí solos hacen un caso para el in-situ. Para los trabajos de HPC a gran escala, el ahorro de ~43% es lo suficientemente importante como para tener en cuenta el diseño de su flujo de trabajo, no solo un agradable de tener.


In-situ como herramienta de depuración y alerta temprana

Aquí es donde nuestro artículo presenta un territorio genuinamente nuevo que las guías existentes no cubren bien. La visualización in situ no se trata solo de ver los resultados más rápido, es una estrategia de depuración para simulaciones numéricas.

Atrapar la divergencia antes de que te cueste

Cuando una simulación diverge, ya sea por inestabilidad numérica, desajustes de parámetros físicos o problemas de calidad de malla, el costo se agrava con cada paso de tiempo. Si está guardando datos para el procesamiento posterior y descubre la divergencia después de que se hayan consumido 50 días centrales, ese es un resultado devastador.

La visualización in situ le brinda retroalimentación visual inmediata. Puede detectar divergencias, inestabilidad o anomalías en el momento en que se desarrollen y detengan la simulación antes de que desperdicie millones de horas centrales. El informe DAG de Bennett (2019) sobre la visualización in situ describe esto como el concepto de «panel de simulación», utilizando la visualización en tiempo real para la depuración visual, la programación conjunta y la dirección.

Varios estudios refuerzan este patrón:

  • Los ejemplos prácticos de CFD de Kitware (2024) describen la «detección de errores tempranos a través de la retroalimentación visual inmediata» como un beneficio central
  • El trabajo de monitoreo de defectos impulsado por ML de Sandia (Shaaban 2026, Shead 2023) utiliza tuberías in situ para la detección de anomalías
  • La Guía de Mejores Prácticas de Excellerat (2022) enmarca la visualización en tiempo real como una herramienta de prevención de errores para los flujos de trabajo de ExaScale

Casos prácticos de uso de depuración

Aquí hay escenarios en los que la visualización in situ vale la pena como una herramienta de depuración:

  • Simulaciones de física acopladas — Detectar infracciones de energía o de conservación de masas antes de que se agraven
  • Refinamiento de malla adaptativa (AMR) — Verificando la calidad de la malla y la lógica de refinamiento a medida que se desarrolla
  • Turbulencia y CFD — Detección de oscilaciones no físicas, artefactos de choque o difusión numérica
  • Reacción-difusión y campo de fase — Identificación de interfaces inestables o deriva de parámetros

La información clave: no está esperando hasta que la simulación termine de saber si se está comportando correctamente. Ya sabes mientras se está ejecutando.

Lo que recomendamos: si su simulación es computacionalmente costosa (más de unas pocas horas en varios nodos) o se acopla físicamente, ejecútela in situ con al menos una visualización de diagnóstico: un corte a través de una variable clave, un gráfico de historial de tiempo o un Isosuperficie. Incluso una sola parcela in situ puede ahorrarle días de tiempo informático desperdiciado.


Marco de decisión: 6 criterios para guiar su elección

El marco clásico de «tamaño de datos» como el factor decisivo está incompleto. La Guía de mejores prácticas de Excellerat (2022) y los estudios de flujo de trabajo de HPC múltiples sugieren un conjunto más rico de criterios. Aquí hay seis factores para sopesar al elegir entre el procesamiento in situ y el posprocesamiento.

1. Suficiencia de ancho de banda de E/S

Pregunta: ¿Tiene su sistema suficiente ancho de banda de E/S para escribir sus conjuntos de datos completos en la frecuencia que necesita?

Si esto es… Recomendación
Limitado (almacenamiento compartido, sistema de archivos congestionado) Apoye hacia in-situ — Evite escribir conjuntos de datos completos
Abundante (almacenamiento dedicado de alta velocidad, E/S a rayas) Postprocessing es factible y más flexible

Por qué: si su simulación ya está saturada de E/S, agregar conjuntos de datos de visualización completa puede causar contención de E/S que ralentiza la simulación en sí. In-situ pasa por alto la ruta de E/S completamente para la visualización.

2. Restricciones de cuota de almacenamiento

Pregunta: ¿Está limitado por las políticas de almacenamiento o cuota de almacenamiento?

Si esto es… Recomendación
Cuota ajustada (asignación de almacenamiento limitado, políticas estrictas) Inclínate hacia in-situ — reduce la huella del disco
Amplia cuota (asignación generosa, políticas flexibles) Posprocesamiento sigue siendo viable

Por qué: Las grandes simulaciones pueden generar terabytes de salida. Si su cuota de almacenamiento es fija, in-situ reduce la cantidad que necesita ahorrar mientras conserva los conocimientos que necesita.

3. Necesidades de resolución temporal

Pregunta: ¿Necesita observar fenómenos temporales de grano fino (por ejemplo, autoignición en combustión, propagación de ondas, cascadas de turbulencia)?

Si esto es… Recomendación
Fenómenos de alta frecuencia (escalas de tiempo breves, eventos rápidos) Apoyarse hacia in-situ — CAN Análisis de salida a alta frecuencia
Fenómenos más gruesos (procesos lentos, estado estacionario) Posprocesamiento es suficiente

Por qué: El ejemplo de convergencia/combustión de Kitware (2024) demuestra cómo in-situ puede salvar las superficies de temperatura y gradiente de presión a alta frecuencia, capturando fenómenos que se perderían si el conjunto de datos completo se escribiera a una frecuencia más baja. El conjunto de datos completo de ese caso fue de ~100 GB, pero in situ redujo los datos guardados a ~100 MB mientras se conservan las características críticas.

4. Previsibilidad del análisis

Pregunta: ¿Sabes lo que quieres visualizar de antemano o explorarás libremente?

Si esto es… Recomendación
Predeterminado (campos específicos, cortes, isosuperficies, estadísticas) Inclínate hacia in-situ — Pipelines predefinidos Excel
Exploratorio (desconocido lo que necesitará, iterando en el análisis) Apoye hacia Postprocessing — Ganancias de exploración interactiva

Por qué: las canalizaciones in situ se definen antes o durante la ejecución de la simulación. No puedes cambiarlos de forma interactiva. Si está descubriendo nuevos fenómenos o iterando en los parámetros de visualización, el procesamiento posterior le brinda la flexibilidad.

5. Tolerancia a la contención de recursos

Pregunta: ¿Puedes tolerar los recursos informáticos consumidos por la visualización que se ejecutan junto con la simulación?

Si esto es… Recomendación
Baja tolerancia a la contención (horarios restringidos y restringidos de recursos) Apoye hacia Posprocesamiento — Los recursos separados evitan la contención
Programación flexible (puede compartir recursos, tener espacio libre) Inclínate hacia in-situ — El análisis se ejecuta al mismo tiempo

Por qué: la visualización in situ comparte recursos de cómputo con la simulación. Si su simulación ya está restringida por recursos, agregar código de visualización puede ralentizarla. El análisis de tensión de Moreland (2016) cubre esta compensación en detalle.

6. Necesidades de archivo y reanálisis

Pregunta: ¿Necesitará volver a analizar este conjunto de datos más adelante con nuevos filtros o diferentes parámetros de visualización?

Si esto es… Recomendación
Sí — Se espera un nuevo análisis de archivo o futuro Posprocesamiento Conserva los datos completos para mayor flexibilidad
No, extraerá lo que necesita ahora y archivará datos reducidos in-situ es apropiado; Ya has extraído las representaciones necesarias

Por qué: Esta es la compensación más comúnmente pasada por alto. Cuando in-situ descarta datos sin procesar después de producir representaciones reducidas (bases de datos de cine, isosuperficies, estadísticas), pierde la capacidad de volver a analizar con nuevos filtros. Los usuarios que cambian a in-situ sin planificar el archivo a menudo se arrepienten de no conservar los datos sin procesar.

Lo que recomendamos: Ejecute este marco de decisión contra su simulación específica. Si los criterios de 4+ se inclinan hacia el in situ, es probable que sea la elección correcta. Si 4+ se inclina hacia el posprocesamiento, siga el flujo de trabajo tradicional. Si los criterios se dividen de manera uniforme, la estrategia híbrida (siguiente sección) puede ser su mejor camino.


La estrategia híbrida: estándar moderno

El estándar emergente para los flujos de trabajo de HPC maduros no es «in situ versus postprocesamiento», es ambos.

El patrón es sencillo: realice la reducción de datos y la extracción de características in situ, luego genere la visualización in-transit en los datos reducidos. El ejemplo canónico es el flujo de trabajo Catalyst-Adios2: Catalyst realiza una reducción de datos in situ (extracción de isossuperficies, estadísticas de cálculo, generación de bases de datos de cine) y ADIOS2 transporta los conjuntos de datos reducidos a los nodos de visualización para la exploración post-hoc.

Este enfoque captura los beneficios de ambos mundos:

  • Reducción in situ Elimina los cuellos de botella de E/S y el tiempo de inactividad (ahorro de energía)
  • Exploración en tránsito Conserva la flexibilidad para el análisis iterativo
  • Ahorro selectivo significa que solo escribes los datos que realmente necesitas

La descripción general de HPC más amplia de Kitware 2025 lo enmarca como el patrón predeterminado para los flujos de trabajo «preparados a ExaScale». El documento ARXIV 2024 «Análisis híbrido in situ en tránsito con Catalyst-Adios2» describe en detalle el patrón moderno típico.

Flujo de trabajo híbrido

  1. Definir Pipelines de visualización y análisis antes de que comience la simulación (scripts de catalizador, recetas de ascenso)
  2. Ejecutar La simulación con reducción de datos in situ: extraiga las funciones que necesita mientras se ejecuta
  3. Monitor a través de parcelas o instantáneas en tiempo real para la depuración y la dirección
  4. Guardar solo los conjuntos de datos reducidos (no el estado de simulación completo)
  5. Postprocess sobre los datos reducidos utilizando Paraview, Visit o su herramienta preferida

Esto es lo que recomienda la Guía de Mejores Prácticas de Excellerat (2022) como el patrón de «mejores prácticas» para la visualización de Exaescale a escala.

Lo que recomendamos: si está ejecutando simulaciones a gran escala (más de 100 GB por ejecución, multinodo o ejecuciones de clúster HPC), adopte la estrategia híbrida como predeterminada. Le brinda los beneficios de rendimiento y energía de in situ sin sacrificar la flexibilidad analítica del posprocesamiento. Solo el procesamiento posterior puro tiene sentido cuando sus conjuntos de datos son lo suficientemente pequeños como para que la sobrecarga de E/S sea insignificante.


Cuando el posprocesamiento todavía gana

El in situ recibe mucha atención, pero el posprocesamiento sigue siendo la elección correcta en varios escenarios importantes. No lo abandone por completo, úselo estratégicamente.

análisis exploratorio

Si está desarrollando nuevas técnicas de visualización, probando canalizaciones de análisis o simplemente explorando un conjunto de datos sin saber lo que necesitará, el procesamiento posterior es incomparable. Puede cargar los datos, aplicar filtros arbitrarios e iterar. Las canalizaciones in situ no pueden ofrecer esta flexibilidad, requieren una lógica predefinida.

Pequeños conjuntos de datos

Si su simulación produce menos de unos pocos gigabytes por ejecución y se ejecuta en un solo nodo o en un grupo pequeño, es probable que la sobrecarga de E/S del procesamiento posterior sea insignificante. La flexibilidad del posprocesamiento supera el menor costo de rendimiento.

Desarrollo de algoritmos

Cuando está desarrollando nuevos métodos numéricos, probando tasas de convergencia o iterando en parámetros del solucionador, necesita una fidelidad completa de datos. El postprocesamiento conserva cada paso de tiempo y cada campo. Reducción in situ descarta información que luego puede arrepentirse de perder.

Archivo y reproducibilidad

Si su simulación es parte de un estudio publicado o de un flujo de trabajo reproducible, el procesamiento posterior le brinda una pista de auditoría clara: los archivos de datos sin procesar, los scripts de procesamiento posterior, las visualizaciones resultantes. La compensación de «pérdida de datos» de in-situ (descarte el estado de simulación sin procesar después de la extracción) hace que la reproducibilidad sea más difícil cuando necesita volver a analizar con nuevos métodos.

Cuándo elegir el procesamiento posterior sobre el in situ

Utilice el procesamiento posterior cuando:

  • Su conjunto de datos es lo suficientemente pequeño como para que la sobrecarga de E/S sea aceptable
  • Necesitas análisis iterativo y exploratorio
  • estás desarrollando o probando nuevas técnicas de visualización
  • La reproducibilidad y el archivo requieren una conservación completa de los datos
  • No tiene acceso a herramientas compatibles con las herramientas o la experiencia de integración

Resumen de paisaje de herramientas

No necesita construir infraestructura in situ desde cero. Varias herramientas maduras hacen que la integración sea sencilla.

Catalizador de paravista

La biblioteca in situ más ampliamente adoptada. Paraview Catalyst proporciona una API pequeña y estable para códigos de simulación para exponer estructuras de datos en la memoria al motor de procesamiento de ParaView. Una vez instrumentado con Catalyst, un código de simulación puede aprovechar las capacidades completas de análisis y visualización de ParaView.

  • Mejor para: Simulaciones de CFD a gran escala, combustión y multifísica
  • Ejemplo: Converge CFD utiliza catalizador para el análisis de combustión in situ (Kitware 2024)
  • Complejidad de integración: Moderado: requiere instrumentación inicial, luego ejecuta scripts de Catalyst como canalizaciones predefinidas

Ascenso

Un marco in situ ligero de Kitware diseñado para una fácil integración. Ascent proporciona un lenguaje de recetas basado en YAML para definir canalizaciones in situ sin un conocimiento profundo de C++.

  • Lo mejor para: equipos que desean una rápida integración in situ sin cambios de código profundos
  • Complejidad de integración: baja — Recetas YAML, necesaria integración de C++ mínima
  • limitación: ecosistema más pequeño que el catalizador; Menos maduro para implementaciones de ExaScale

Visita Libsim

La biblioteca in situ para visitar. Similar al catalizador pero integrado con el ecosistema de visita.

  • Lo mejor para: equipos ya invertidos en el ecosistema de visitas
  • Complejidad de integración: moderado: requiere instrumentación libsim

dama

Un marco in situ más nuevo y basado en estándares diseñado para la portabilidad en las herramientas de visualización. Damaris utiliza una API estandarizada que desacopla la simulación de los backends de visualización específicos.

  • Lo mejor para: implementaciones multiecosistema (que desea utilizar varias herramientas de visualización)
  • Complejidad de integración: superior: cadena de herramientas más nueva y menos establecida
  • Notable: ganar tracción en las comunidades europeas de HPC

Guía de selección de herramientas

Si necesitas… Recomendar
El ecosistema más grande, la mayoría de los ejemplos Catalizador de paraview
Integración rápida, C++ mínimo Ascenso
Visita la alineación del ecosistema Visita Libsim
Portabilidad multiherramienta Damaris

La Guía de mejores prácticas de Excellerat (2022) proporciona tablas de comparación detalladas para interfaces in situ y recomendaciones de herramientas en ExaScale. Su análisis sugiere Catalyst como la opción más madura para los flujos de trabajo de HPC de producción, con Ascent como una alternativa ligera y ligera.


Resumen + Próximos pasos

Elegir entre la visualización in situ y el procesamiento posterior no es una pregunta binaria de «cuál es mejor». Es una decisión de diseño de flujo de trabajo que debe tener en cuenta el tamaño de los datos, la energía, las necesidades de depuración, la flexibilidad y las consideraciones de archivo.

Aquí está nuestra recomendación destilada a tres principios:

  1. Para las simulaciones HPC a gran escala (más de 100 GB, multinodo), adopte la estrategia híbrida: reducción in situ con ahorro selectivo, seguido de procesamiento posterior en los datos reducidos. Esto le brinda ahorros de energía (~43 % de reducción total de energía por estudios de VT), los beneficios de depuración y la flexibilidad analítica que necesita.
  2. Para las simulaciones de pequeño a mediano (<10 GB, un solo nodo o un grupo pequeño), el procesamiento posterior suele ser más simple y más flexible. No agregue complejidad in situ a menos que necesite específicamente los beneficios de depuración o energía.
  3. Siempre considere la depuración. Incluso si elige el procesamiento posterior para el flujo de trabajo principal, ejecutar al menos un gráfico de diagnóstico in situ (un historial de tiempo, un segmento de clave o un monitor de convergencia) puede ahorrarle horas de tiempo de cálculo desperdiciado cuando se produce una divergencia.

Próximos pasos prácticos

  • Si su flujo de trabajo actual es puramente posprocesado y está ejecutando grandes simulaciones: evalúe el catalizador o el ascenso para la reducción de datos in situ. Incluso una simple canalización predefinida o canalización de estadísticas cortará E/S y el tiempo de inactividad.
  • Si ya está utilizando in-situ pero no ha explorado la depuración: agregue al menos una visualización de advertencia temprana (parcela de historial de tiempo, isosuperficie de un campo clave o detección de anomalías). El concepto de «panel de simulación» de Bennett (2019) es un buen punto de partida.
  • Si está planeando flujos de trabajo de archivo: decida qué datos sin procesar conservar antes de cambiar a in situ. No descarte el estado de simulación que podría necesitar para el análisis futuro.

La decisión de visualización es una de las pocas opciones de flujo de trabajo de simulación que afecta directamente tanto al rendimiento como a la calidad del conocimiento. Hazlo bien y tus simulaciones se ejecutan más rápido, ahorra energía y detecta errores antes de tiempo. Hazlo mal y pierdes tiempo de cálculo, almacenamiento y potencialmente perderás fenómenos que no puedes volver a analizar. Utilice este marco para tomar una decisión informada.


Guías relacionadas

Para una cobertura más profunda sobre temas relacionados, aquí hay algunos recursos adicionales de nuestro sitio:


Referencias y fuentes citadas en este artículo: