El objetivo general de esta tesis es conocer y gestionar las posibilidades de ahorro energético que se presentan al utilizar el método de tolerancia a fallos basado en checkpoint/restart en sistemas de cómputo de altas prestaciones. Los aportes son los siguientes:
- Un método para construir modelos de predicción del consumo de energía, para checkpoint/restart coordinado a nivel de sistema, en aplicaciones SPMD, en rollback homogéneos.
- Un modelo de predicción del consumo energético del checkpoint/restart para una aplicación de propagación de calor que sigue el paradigma de programación paralela SPMD.
- Un estudio de los factores del sistema (hardware y software) y de aplicación que impactan en el consumo de energía producido por las operaciones de checkpoint y restart.
- La definición de una serie de estrategias para el ahorro energético cuando se produce un fallo y sólo recuperan los procesos que han fallado, contemplando que se comunican directa e indirectamente con el proceso fallado.
- La definición de un modelo que permita evaluar el impacto de la aplicación de estrategias sobre el consumo energético bajo diferentes escenarios.
- El diseño y desarrollo de un simulador que usando el modelo anterior permite evaluar las estrategias propuestas y determinar la más conveniente desde el punto de vista energético.