Mostrar el registro sencillo del ítem
dc.contributor.author
Montezanti, Diego Miguel
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.contributor.author
Frati, Fernando Emmanuel
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.contributor.author
Rexachs, Dolores
dc.contributor.author
Luque, Emilio
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.contributor.author
Naiouf, Ricardo Marcelo
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.contributor.author
de Giusti, Armando Eduardo
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.date.available
2023-05-10T15:19:01Z
dc.date.issued
2012-12
dc.identifier.citation
Montezanti, Diego Miguel; Frati, Fernando Emmanuel; Rexachs, Dolores; Luque, Emilio; Naiouf, Ricardo Marcelo; et al.; SMCV: A Methodology for Detecting Transient Faults in Multicore Clusters; Centro Latinoamericano de Estudios en Informática; CLEI Electronic Journal; 15; 3; 12-2012; 1-11
dc.identifier.issn
0717-5000
dc.identifier.uri
http://hdl.handle.net/11336/197026
dc.description.abstract
The challenge of improving the performance of current processors is achieved by increasing the integration scale. This carries a growing vulnerability to transient faults, which increase their impact on multicore clusters running large scientific parallel applications. The requirement for enhancing the reliability of these systems, coupled with the high cost of rerunning the application from the beginning, create the motivation for having specific software strategies for the target systems. This paper introduces SMCV, which is a fully distributed technique that provides fault detection for message-passing parallel applications, by validating the contents of the messages to be sent, preventing the transmission of errors to other processes and leveraging the intrinsic hardware redundancy of the multicore. SMCV achieves a wide robustness against transient faults with a reduced overhead, and accomplishes a trade-off between moderate detection latency and low additional workload.
dc.description.abstract
El desafío de mejorar la potencia de cómputo de los procesadores actuales se logra mediante el aumento en la escala de integración. Esto conlleva una creciente vulnerabilidad a los fallos transitorios, los cuales incrementan su impacto en clusters de multicores que ejecutan aplicaciones paralelas científicas de garn duración. El requerimiento de aumentar la fiabilidad de estos sistemas y el alto costo de relanzar la ejecución desde el comienzo resultan en la necesidad de contar con estrategias de software específicas para ellos. En este trabajo, se presenta SMCV, una técnica totalmente distribuida que provee detección de fallos mediante la validación de los contenidos de los mensajes enviados, impidiendo la propagación de un error a otro proceso y aprovechando la redundancia de hardware intrínseca existente en el multicore. SMCV logra una alta cobertura introduciendo un reducido overhead, y obtiene un compromiso entre una latencia de detección moderada y una baja sobrecarga de trabajo.
dc.format
application/pdf
dc.language.iso
eng
dc.publisher
Centro Latinoamericano de Estudios en Informática
dc.rights
info:eu-repo/semantics/openAccess
dc.rights.uri
https://creativecommons.org/licenses/by-nc-sa/2.5/ar/
dc.subject
TRANSIENT FAULT
dc.subject
SILENT DATA CORRUPTION
dc.subject
MULTICORE CLUSTER
dc.subject
PARALLEL SCIENTIFIC APPLICATION
dc.subject
SOFT ERROR DETECTION
dc.subject
MESSAGE CONTENT VALIDATION
dc.subject
RELIABILITY
dc.subject.classification
Ciencias de la Computación
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.subject.classification
Ciencias de la Computación e Información
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.subject.classification
CIENCIAS NATURALES Y EXACTAS
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.title
SMCV: A Methodology for Detecting Transient Faults in Multicore Clusters
dc.type
info:eu-repo/semantics/article
dc.type
info:ar-repo/semantics/artículo
dc.type
info:eu-repo/semantics/publishedVersion
dc.date.updated
2023-04-10T10:10:54Z
dc.journal.volume
15
dc.journal.number
3
dc.journal.pagination
1-11
dc.journal.pais
Uruguay
![Se ha confirmado la validez de este valor de autoridad por un usuario](/themes/CONICETDigital/images/authority_control/invisible.gif)
dc.journal.ciudad
Montevideo
dc.description.fil
Fil: Montezanti, Diego Miguel. Consejo Nacional de Investigaciones Científicas y Técnicas. Centro Científico Tecnológico Conicet - La Plata; Argentina. Universidad Nacional de La Plata. Facultad de Informática. Instituto de Investigación en Informática Lidi; Argentina
dc.description.fil
Fil: Frati, Fernando Emmanuel. Consejo Nacional de Investigaciones Científicas y Técnicas. Centro Científico Tecnológico Conicet - La Plata; Argentina. Universidad Nacional de La Plata. Facultad de Informática. Instituto de Investigación en Informática Lidi; Argentina
dc.description.fil
Fil: Rexachs, Dolores. Universidad Autonoma de Barcelona. Dto Arquitectura Computadoras y Sist/operativos; España
dc.description.fil
Fil: Luque, Emilio. Universidad Autonoma de Barcelona. Dto Arquitectura Computadoras y Sist/operativos; España
dc.description.fil
Fil: Naiouf, Ricardo Marcelo. Universidad Nacional de La Plata. Facultad de Informática. Instituto de Investigación en Informática Lidi; Argentina
dc.description.fil
Fil: de Giusti, Armando Eduardo. Consejo Nacional de Investigaciones Científicas y Técnicas. Centro Científico Tecnológico Conicet - La Plata; Argentina. Universidad Nacional de La Plata. Facultad de Informática. Instituto de Investigación en Informática Lidi; Argentina
dc.journal.title
CLEI Electronic Journal
dc.relation.alternativeid
info:eu-repo/semantics/altIdentifier/url/http://www.scielo.edu.uy/scielo.php?script=sci_arttext&pid=S0717-50002012000300006
Archivos asociados