{"id":1247,"date":"2026-08-21T14:28:32","date_gmt":"2026-08-21T14:28:32","guid":{"rendered":"https:\/\/matforge.org\/?p=1247","raw":"https:\/\/matforge.org\/?p=1247"},"modified":"2026-08-21T14:28:32","modified_gmt":"2026-08-21T14:28:32","slug":"managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research","status":"publish","type":"post","link":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/","title":{"rendered":"G\u00e9rer des ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle : strat\u00e9gies de stockage pour la recherche \u00e0 long terme","raw":"G\u00e9rer des ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle : strat\u00e9gies de stockage pour la recherche \u00e0 long terme"},"content":{"rendered":"<span class=\"span-reading-time rt-reading-time\" style=\"display: block;\"><span class=\"rt-label rt-prefix\">Reading Time: <\/span> <span class=\"rt-time\"> 12<\/span> <span class=\"rt-label rt-postfix\">minutes<\/span><\/span><p>Vos sorties de simulation ne sont pas seulement des fichiers. Ce sont des atouts de recherche. Lorsqu&rsquo;une ex\u00e9cution \u00e0 plusieurs n\u0153uds se termine et g\u00e9n\u00e8re des centaines de gigaoctets sur des milliers de pas de temps, vous ne produisez pas seulement des donn\u00e9es. Vous cr\u00e9ez des preuves scientifiques qui doivent survivre aux mises \u00e0 niveau mat\u00e9rielles, au roulement du personnel et aux migrations de stockage institutionnels.<\/p>\n<p>Ce guide explique comment structurer la gestion de l&rsquo;ensemble de donn\u00e9es afin que votre travail reste accessible, reproductible et significatif des ann\u00e9es apr\u00e8s la fin de la campagne de simulation.<\/p>\n<h2>Points \u00e0 retenir cl\u00e9s<\/h2>\n<ul>\n<li>Le stockage en plusieurs niveaux s\u00e9pare les donn\u00e9es de calcul actives du stockage d&rsquo;archives, optimisant les performances et les co\u00fbts.<\/li>\n<li>Des principes \u00e9quitables \u2013 accessibles, accessibles, interop\u00e9rables et r\u00e9utilisables \u2013 fournissent un cadre pratique pour la gestion \u00e0 long terme des donn\u00e9es scientifiques.<\/li>\n<li>Les plans de gestion des donn\u00e9es doivent \u00eatre r\u00e9dig\u00e9s avant les premi\u00e8res ex\u00e9cutions de simulation, et non apr\u00e8s que l&rsquo;archive soit d\u00e9j\u00e0 pleine.<\/li>\n<li>Les m\u00e9tadonn\u00e9es et la provenance ne sont pas des extras optionnels. Ils d\u00e9terminent si les donn\u00e9es sont r\u00e9utilisables ou orphelines.<\/li>\n<\/ul>\n<h2>Le probl\u00e8me auquel vous \u00eates r\u00e9ellement confront\u00e9<\/h2>\n<p>Le principal probl\u00e8me n&rsquo;est pas la capacit\u00e9 de stockage. C&rsquo;est un effondrement organisationnel.<\/p>\n<p>Un projet typique de science des mat\u00e9riaux informatiques ou de dynamique des fluides g\u00e9n\u00e8re des donn\u00e9es dans plusieurs formats en plusieurs \u00e9tapes&nbsp;:<\/p>\n<ul>\n<li>Sortie de simulation brute, y compris les fichiers de point de contr\u00f4le, les vidages de diagnostic et les variables de champ.<\/li>\n<li>R\u00e9sultats interm\u00e9diaires, y compris les quantit\u00e9s post-trait\u00e9es, les valeurs d\u00e9riv\u00e9es et les donn\u00e9es pr\u00eates \u00e0 l&rsquo;analyse.<\/li>\n<li>Donn\u00e9es publi\u00e9es finales, y compris les chiffres, les tableaux et les ensembles de donn\u00e9es suppl\u00e9mentaires s\u00e9lectionn\u00e9s.<\/li>\n<li>Artefacts reproductibles, y compris les fichiers d&rsquo;entr\u00e9e, les scripts, les d\u00e9finitions d&rsquo;environnement et les versions logicielles.<\/li>\n<\/ul>\n<p>Ce qui se passe ensuite d\u00e9termine si le projet devient un point de r\u00e9f\u00e9rence durable ou dispara\u00eet. De nombreux groupes de recherche g\u00e8rent cela mal pour plusieurs raisons :<\/p>\n<ol>\n<li>Les donn\u00e9es sont stock\u00e9es sur les n\u0153uds de calcul. Lorsqu&rsquo;un cluster est mis \u00e0 niveau ou mis hors service, les donn\u00e9es peuvent dispara\u00eetre.<\/li>\n<li>Les m\u00e9tadonn\u00e9es sont absentes. Personne ne sait ce que repr\u00e9sente un ensemble de donn\u00e9es sans demander au chercheur d&rsquo;origine.<\/li>\n<li>Il n&rsquo;y a pas de plan de conservation. L&rsquo;hypoth\u00e8se selon laquelle l&rsquo;\u00e9quipe le sauvegardera plus tard \u00e9choue souvent.<\/li>\n<li>Les formats deviennent obsol\u00e8tes. Les formats binaires propri\u00e9taires peuvent d\u00e9pendre d&rsquo;un package logiciel ou d&rsquo;une version.<\/li>\n<\/ol>\n<p>C&rsquo;est le principal d\u00e9fi. Une strat\u00e9gie de gestion d&rsquo;ensemble de donn\u00e9es doit aborder l&rsquo;\u00e9chelle, l&rsquo;organisation, l&rsquo;accessibilit\u00e9 et la long\u00e9vit\u00e9 en m\u00eame temps.<\/p>\n<h2>Architecture de stockage \u00e0 plusieurs niveaux : la fondation<\/h2>\n<p>Le stockage par niveau est l&rsquo;\u00e9pine dorsale de la gestion des donn\u00e9es scientifiques. Au lieu de tout stocker sur le m\u00eame support, vous s\u00e9parez les donn\u00e9es \u00e0 travers des niveaux optimis\u00e9s pour diff\u00e9rents mod\u00e8les d&rsquo;acc\u00e8s et profils de co\u00fbts.<\/p>\n<h3>Niveau&nbsp;0&nbsp;: stockage de calcul actif<\/h3>\n<p>Moyenne : SSD NVMe et syst\u00e8mes de fichiers parall\u00e8les tels que Lustre, IBM Spectrum Scale ou BEEGFS.<\/p>\n<p>Objectif : C&rsquo;est l\u00e0 que les donn\u00e9es vivent pendant le calcul actif. Cela n\u00e9cessite :<\/p>\n<ul>\n<li>Bande passante \u00e9lev\u00e9e pour les E\/S distribu\u00e9es.<\/li>\n<li>Faible latence pour le red\u00e9marrage du point de contr\u00f4le et l&rsquo;analyse en temps r\u00e9el.<\/li>\n<li>Basculement automatique pour r\u00e9duire le risque de perte de donn\u00e9es lors de d\u00e9faillances de n\u0153uds.<\/li>\n<\/ul>\n<p>Les donn\u00e9es appartiennent ici lorsque des fichiers sont activement \u00e9crits, lus ou modifi\u00e9s en ex\u00e9cutant des simulations et des travaux de post-traitement.<\/p>\n<p>Un pi\u00e8ge courant consiste \u00e0 traiter ce niveau comme un stockage permanent. Les syst\u00e8mes de niveau 0 sont con\u00e7us pour le d\u00e9bit, et non pour la durabilit\u00e9 \u00e0 long terme. Lorsque le cluster est remplac\u00e9, les donn\u00e9es laiss\u00e9es au niveau 0 peuvent \u00eatre perdues.<\/p>\n<h3>Niveau 1 : stockage de recherche primaire<\/h3>\n<p>Moyenne : baies de disque dur de haute capacit\u00e9 et stockage d&rsquo;objets distribu\u00e9s.<\/p>\n<p>Objectif : Il s&rsquo;agit de l&rsquo;archive de travail. Les donn\u00e9es sont accessibles r\u00e9guli\u00e8rement pendant le cycle de vie du projet actif, mais elles ne n\u00e9cessitent pas de latence inf\u00e9rieure \u00e0 la milliseconde.<\/p>\n<p>Les donn\u00e9es appartiennent ici lorsqu&rsquo;elles comprennent des cycles de simulation termin\u00e9s, des r\u00e9sultats d&rsquo;analyse interm\u00e9diaire et des ensembles de donn\u00e9es activement utilis\u00e9s par les collaborateurs.<\/p>\n<p>Les mod\u00e8les d&rsquo;acc\u00e8s communs incluent des lectures de fichiers complets, des requ\u00eates de m\u00e9tadonn\u00e9es et des sous-ensembles s\u00e9lectifs.<\/p>\n<p>Les meilleures pratiques comprennent :<\/p>\n<ul>\n<li>La migration automatis\u00e9e \u00e0 partir du niveau 0 une fois les op\u00e9rations d&rsquo;\u00e9criture cessantes.<\/li>\n<li>Copie redondante apr\u00e8s 3 copies, r\u00e8gle de 2 types de supports.<\/li>\n<li>Contr\u00f4le de l&rsquo;int\u00e9grit\u00e9 gr\u00e2ce \u00e0 des sommes de contr\u00f4le et \u00e0 la d\u00e9tection d&rsquo;erreurs.<\/li>\n<\/ul>\n<h3>Niveau 2 : stockage frigorifique et archives<\/h3>\n<p>Support : stockage d&rsquo;objets tels que S3 ou Azure BLOB, biblioth\u00e8ques de bandes et syst\u00e8mes d&rsquo;archives approfondies.<\/p>\n<p>Objectif : Ce niveau prend en charge la pr\u00e9servation \u00e0 long terme. Les donn\u00e9es sont rarement accessibles mais doivent rester intactes pendant des ann\u00e9es ou des d\u00e9cennies.<\/p>\n<p>Les donn\u00e9es appartiennent ici lorsqu&rsquo;elles comprennent des projets termin\u00e9s, des suppl\u00e9ments de publication, des d\u00e9p\u00f4ts de r\u00e9f\u00e9rentiel et des ensembles de donn\u00e9es datant de plus de plusieurs ann\u00e9es.<\/p>\n<p>Le niveau de conservation principal devrait \u00eatre immuable lorsque cela est possible. Les d\u00e9p\u00f4ts de stockage ou de r\u00e9f\u00e9rentiel en lecture seules permettent d&#8217;emp\u00eacher la suppression ou la modification accidentelle.<\/p>\n<h2>Le cycle de vie des donn\u00e9es : de la cr\u00e9ation \u00e0 la conservation<\/h2>\n<p>Comprendre comment les donn\u00e9es \u00e9voluent dans son cycle de vie vous aide \u00e0 choisir la bonne strat\u00e9gie \u00e0 chaque phase.<\/p>\n<h3>Phase 1 : Planifiez avant de courir<\/h3>\n<p>C&rsquo;est l\u00e0 que de nombreux chercheurs \u00e9chouent. Vous avez besoin d&rsquo;un plan de gestion des donn\u00e9es avant l&rsquo;ex\u00e9cution de la premi\u00e8re simulation.<\/p>\n<p>Un plan de gestion des donn\u00e9es r\u00e9pond \u00e0 plusieurs questions pratiques :<\/p>\n<ul>\n<li>Quelles donn\u00e9es seront g\u00e9n\u00e9r\u00e9es et combien ?<\/li>\n<li>Quels formats stockeront les donn\u00e9es&nbsp;?<\/li>\n<li>Quels ensembles de donn\u00e9es sont essentiels et lesquels sont jetables ?<\/li>\n<li>O\u00f9 les donn\u00e9es seront-elles stock\u00e9es pendant la recherche active&nbsp;?<\/li>\n<li>Qui a acc\u00e8s et quand l&rsquo;acc\u00e8s s&rsquo;arr\u00eate-t-il&nbsp;?<\/li>\n<li>Comment les m\u00e9tadonn\u00e9es documenteront-elles les donn\u00e9es&nbsp;?<\/li>\n<\/ul>\n<p>Les outils recommand\u00e9s incluent DMPTool, RDMO ou le mod\u00e8le de gestion des donn\u00e9es de recherche de votre \u00e9tablissement. De nombreux bailleurs de fonds exigent d\u00e9sormais des plans de gestion des donn\u00e9es pour les demandes de subvention.<\/p>\n<h3>Phase 2 : Cr\u00e9ation et validation actives<\/h3>\n<p>Lors de l&rsquo;ex\u00e9cution de la simulation, la gestion des donn\u00e9es se concentre sur plusieurs priorit\u00e9s&nbsp;:<\/p>\n<ul>\n<li>Int\u00e9grit\u00e9 en temps r\u00e9el. Valider les sorties imm\u00e9diatement apr\u00e8s la fin du point de contr\u00f4le.<\/li>\n<li>archivage s\u00e9lectif. N&rsquo;archivez pas tout. Archivez ce qui est pertinent pour la publication ou scientifiquement pr\u00e9cieux.<\/li>\n<li>Provenance automatis\u00e9e. Enregistrez les versions des logiciels, les fichiers de param\u00e8tres et les environnements d&rsquo;ex\u00e9cution \u00e0 c\u00f4t\u00e9 des donn\u00e9es.<\/li>\n<li>Conventions de nommage. Utilisez des noms de fichiers coh\u00e9rents et analys\u00e9s par la machine qui encodent la structure et activent l&rsquo;automatisation.<\/li>\n<\/ul>\n<h3>Phase 3 : Analyse active et partage<\/h3>\n<p>Une fois les simulations termin\u00e9es et les donn\u00e9es migr\u00e9es vers le niveau&nbsp;1, l&rsquo;accent est mis sur l&rsquo;analyse et la collaboration.<\/p>\n<ul>\n<li>Utilisez des strat\u00e9gies de sous-ensemble. Stockez les donn\u00e9es afin de pouvoir lire des pas de temps individuels ou des r\u00e9gions spatiales sans charger des fichiers entiers. HDF5 et NETCDF prennent en charge cette fonction gr\u00e2ce \u00e0 des s\u00e9lections Hyperslab.<\/li>\n<li>Prenez soigneusement des d\u00e9cisions de compression. La compression sans perte peut r\u00e9duire les co\u00fbts de stockage d&rsquo;archives, mais la d\u00e9compression utilise le temps CPU.<\/li>\n<li>Soutenir l&rsquo;acc\u00e8s collaboratif Utilisez des montages en lecture seule ou des catalogues de donn\u00e9es s\u00e9lectionn\u00e9s au lieu de dupliquer des donn\u00e9es dans de nombreux r\u00e9pertoires.<\/li>\n<\/ul>\n<h3>Phase 4 : Pr\u00e9servation et partage<\/h3>\n<p>Une fois le projet termin\u00e9, l&rsquo;objectif est de pr\u00e9server les donn\u00e9es sous une forme que d&rsquo;autres chercheurs peuvent comprendre et r\u00e9utiliser.<\/p>\n<ul>\n<li>D\u00e9posez des ensembles de donn\u00e9es organis\u00e9es dans des r\u00e9f\u00e9rentiels sp\u00e9cifiques \u00e0 un domaine, des r\u00e9f\u00e9rentiels institutionnels ou des services tels que Zenodo.<\/li>\n<li>Obtenez des identifiants persistants tels que DOI afin que les donn\u00e9es puissent \u00eatre cit\u00e9es et trac\u00e9es.<\/li>\n<li>Ajoutez une licence lisible par machine telle que Creative Commons ou Open Data Commons.<\/li>\n<li>Incluez un package de documentation avec des fichiers Lisez-moi, des dictionnaires de donn\u00e9es et des descriptions de m\u00e9thodes.<\/li>\n<\/ul>\n<h2>Principes \u00e9quitables : le cadre<\/h2>\n<p>Les principes \u00e9quitables ne sont pas des slogans marketing. Ils sont une norme op\u00e9rationnelle pour la gestion des donn\u00e9es scientifiques et sont soutenus par les principaux bailleurs de fonds et les institutions.<\/p>\n<h3>introuvable<\/h3>\n<p>Les donn\u00e9es peuvent \u00eatre trouv\u00e9es lorsque&nbsp;:<\/p>\n<ol>\n<li>Il a un identifiant persistant, tel qu&rsquo;un DOI ou un PID.<\/li>\n<li>Il est d\u00e9crit avec des m\u00e9tadonn\u00e9es riches, pas seulement des noms de fichiers.<\/li>\n<li>Les m\u00e9tadonn\u00e9es sont index\u00e9es dans des catalogues ou des r\u00e9f\u00e9rentiels consultables.<\/li>\n<\/ol>\n<p>Une impl\u00e9mentation pratique consiste \u00e0 enregistrer des ensembles de donn\u00e9es dans ZeNoDo ou dans un r\u00e9f\u00e9rentiel sp\u00e9cifique \u00e0 un domaine. Utilisez des vocabulaires contr\u00f4l\u00e9s pour des quantit\u00e9s physiques au lieu d&rsquo;\u00e9tiquettes incoh\u00e9rentes telles que \u00ab\u00a0Temp\u00e9rature\u00a0\u00bb, \u00ab\u00a0Temp\u00a0\u00bb et \u00ab\u00a0T_Field\u00a0\u00bb.<\/p>\n<h3>accessible<\/h3>\n<p>Les donn\u00e9es sont accessibles lorsque :<\/p>\n<ol>\n<li>Il peut \u00eatre r\u00e9cup\u00e9r\u00e9 via des protocoles standard tels que HTTP, FTP ou une API S3.<\/li>\n<li>Les r\u00e8gles d&rsquo;authentification et d&rsquo;autorisation sont clairement d\u00e9finies.<\/li>\n<li>Les m\u00e9tadonn\u00e9es restent accessibles m\u00eame lorsque les donn\u00e9es brutes sont archiv\u00e9es.<\/li>\n<\/ol>\n<h3>interop\u00e9rable<\/h3>\n<p>L&rsquo;interop\u00e9rabilit\u00e9 n\u00e9cessite :<\/p>\n<ol>\n<li>Formats ouverts et standardis\u00e9s tels que HDF5, NETCDF, CSV ou JSON.<\/li>\n<li>Vocabulaires communautaires reconnus par votre discipline.<\/li>\n<li>R\u00e9f\u00e9rences qualifi\u00e9es qui lient des donn\u00e9es \u00e0 des publications, des logiciels et des ensembles de donn\u00e9es connexes.<\/li>\n<\/ol>\n<h3>r\u00e9utilisable<\/h3>\n<p>La r\u00e9utilisation d\u00e9pend de :<\/p>\n<ol>\n<li>Documentation claire de provenance des donn\u00e9es brutes aux chiffres publi\u00e9s.<\/li>\n<li>Licence explicite qui explique ce que les autres peuvent faire avec les donn\u00e9es.<\/li>\n<li>Conformit\u00e9 aux normes communautaires et aux sch\u00e9mas de m\u00e9tadonn\u00e9es sp\u00e9cifiques au domaine.<\/li>\n<\/ol>\n<p>Pour les donn\u00e9es de simulation, les r\u00e9f\u00e9rentiels sp\u00e9cifiques \u00e0 un domaine peuvent \u00eatre particuli\u00e8rement utiles. Par exemple, NOMAD fournit une infrastructure conforme \u00e0 la norme pour la science des mat\u00e9riaux informatiques. Si votre travail implique une dynamique mol\u00e9culaire, une mod\u00e9lisation en champ de phase ou un champ connexe, v\u00e9rifiez si un r\u00e9f\u00e9rentiel de domaine existe.<\/p>\n<h2>M\u00e9tadonn\u00e9es et provenance&nbsp;: ce qui compte r\u00e9ellement<\/h2>\n<p>Les m\u00e9tadonn\u00e9es sont l&rsquo;un des points de d\u00e9faillance les plus courants dans la gestion des donn\u00e9es scientifiques. Un ensemble de donn\u00e9es sans m\u00e9tadonn\u00e9es ne sont pas des donn\u00e9es r\u00e9utilisables. C&rsquo;est un myst\u00e8re.<\/p>\n<h3>Champs de m\u00e9tadonn\u00e9es essentiels<\/h3>\n<table class=\"custom-table\">\n<tbody>\n<tr>\n<th>Champ de m\u00e9tadonn\u00e9es<\/th>\n<th>Ce qu&rsquo;il devrait capturer<\/th>\n<th>Pourquoi c&rsquo;est important<\/th>\n<\/tr>\n<tr>\n<td>Nom du projet<\/td>\n<td>Identificateur de projet de recherche, de subvention ou de campagne<\/td>\n<td>Connecte l&rsquo;ensemble de donn\u00e9es \u00e0 son contexte scientifique<\/td>\n<\/tr>\n<tr>\n<td>Objectif de simulation<\/td>\n<td>Question, hypoth\u00e8se ou benchmark test\u00e9<\/td>\n<td>Explique pourquoi l&rsquo;ensemble de donn\u00e9es existe<\/td>\n<\/tr>\n<tr>\n<td>Param\u00e8tres d&rsquo;entr\u00e9e<\/td>\n<td>Fichiers de configuration, plages de param\u00e8tres, graines al\u00e9atoires, conditions aux limites<\/td>\n<td>Prend en charge la reproductibilit\u00e9 et les rediffusions<\/td>\n<\/tr>\n<tr>\n<td>Environnement logiciel<\/td>\n<td>Version du solveur, d\u00e9pendances, compilateur, image de conteneur, syst\u00e8me d&rsquo;exploitation<\/td>\n<td>Emp\u00eache l&rsquo;ambigu\u00eft\u00e9 de l&rsquo;environnement<\/td>\n<\/tr>\n<tr>\n<td>Format des donn\u00e9es<\/td>\n<td>Type de fichier, sch\u00e9ma, unit\u00e9s, syst\u00e8me de coordonn\u00e9es, m\u00e9thode de compression<\/td>\n<td>Aide d&rsquo;autres outils \u00e0 lire et \u00e0 interpr\u00e9ter les donn\u00e9es<\/td>\n<\/tr>\n<tr>\n<td>Provenance<\/td>\n<td>Ligne de commande, \u00e9tape de workflow, version de script, commit git<\/td>\n<td>Trace comment les sorties ont \u00e9t\u00e9 g\u00e9n\u00e9r\u00e9es<\/td>\n<\/tr>\n<tr>\n<td>Propri\u00e9t\u00e9 et acc\u00e8s<\/td>\n<td>Cr\u00e9ateur, laboratoire, institution, droits d&rsquo;acc\u00e8s, statut d&#8217;embargo<\/td>\n<td>Clarifie la responsabilit\u00e9 et r\u00e9utilise les r\u00e8gles<\/td>\n<\/tr>\n<tr>\n<td>Licence<\/td>\n<td>R\u00e9utiliser des termes tels que CC BY, CC0 ou une autre licence<\/td>\n<td>Permet aux autres de r\u00e9utiliser les donn\u00e9es l\u00e9galement<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Strat\u00e9gies de suivi de provenance<\/h3>\n<p>Une approche l\u00e9g\u00e8re consiste \u00e0 stocker un fichier de m\u00e9tadonn\u00e9es JSON \u00e0 c\u00f4t\u00e9 de chaque ensemble de donn\u00e9es. Il doit contenir des param\u00e8tres d&rsquo;ex\u00e9cution, des versions de logiciels et une r\u00e9f\u00e9rence au fichier d&rsquo;entr\u00e9e.<\/p>\n<p>Une approche plus robuste consiste \u00e0 utiliser des cadres de suivi de provenance tels que Dagman, Workflow-NG ou MyExperiment pour enregistrer automatiquement chaque \u00e9tape de calcul, fichier d&rsquo;entr\u00e9e et appel logiciel.<\/p>\n<p>La meilleure pratique est simple : enregistrez la ligne de commande exacte utilis\u00e9e pour ex\u00e9cuter la simulation. Il s&rsquo;agit souvent de l&rsquo;artefact de provenance le plus important.<\/p>\n<h2>Strat\u00e9gies de stockage qui fonctionnent r\u00e9ellement<\/h2>\n<h3>Strat\u00e9gie&nbsp;1&nbsp;: Pr\u00e9servation des entr\u00e9es-premi\u00e8res<\/h3>\n<p>Au lieu d&rsquo;archiver des t\u00e9raoctets de sortie brute, conservez l&rsquo;algorithme de g\u00e9n\u00e9ration de donn\u00e9es et ses entr\u00e9es. Si vous pouvez reproduire la simulation, les sorties peuvent \u00eatre d\u00e9riv\u00e9es.<\/p>\n<p>Utilisez cette strat\u00e9gie pour les balayages de param\u00e8tres, les \u00e9tudes de validation et le d\u00e9veloppement d&rsquo;algorithmes o\u00f9 la contribution scientifique est la m\u00e9thodologie plut\u00f4t que chaque fichier de sortie individuel.<\/p>\n<p>Pour l&rsquo;impl\u00e9menter, archiver les fichiers d&rsquo;entr\u00e9e, les scripts de configuration et une proc\u00e9dure de reproduction document\u00e9e. Stockez les sorties de mani\u00e8re s\u00e9lective. Gardez des cas repr\u00e9sentatifs et d\u00e9placez le reste vers des niveaux \u00e0 moindre co\u00fbt si n\u00e9cessaire.<\/p>\n<h3>Strat\u00e9gie 2 : organisation hi\u00e9rarchique par question scientifique<\/h3>\n<p>Structure de stockage pour correspondre \u00e0 la logique de recherche, et non seulement au flux de travail de calcul.<\/p>\n<pre><code>project_name\/\n\u251c\u2500\u2500 00_methods\/\n\u2502   \u251c\u2500\u2500 grid_setup\/\n\u2502   \u251c\u2500\u2500 boundary_conditions\/\n\u2502   \u2514\u2500\u2500 solver_configuration\/\n\u251c\u2500\u2500 01_reference_solutions\/\n\u2502   \u251c\u2500\u2500 analytical\/\n\u2502   \u2514\u2500\u2500 benchmark\/\n\u251c\u2500\u2500 02_parameter_sweeps\/\n\u2502   \u251c\u2500\u2500 sweep_1_conductivity\/\n\u2502   \u251c\u2500\u2500 sweep_2_temperature\/\n\u2502   \u2514\u2500\u2500 sweep_3_pressure\/\n\u251c\u2500\u2500 03_published_results\/\n\u2502   \u251c\u2500\u2500 figures\/\n\u2502   \u251c\u2500\u2500 supplementary\/\n\u2502   \u2514\u2500\u2500 manuscript_data\/\n\u2514\u2500\u2500 metadata\/\n    \u251c\u2500\u2500 README.md\n    \u251c\u2500\u2500 data_dictionary.csv\n    \u2514\u2500\u2500 run_log.csv\n<\/code><\/pre>\n<p>Cette organisation vous aide \u00e0 trouver des ensembles de donn\u00e9es sans recherche et aide les nouveaux membres \u00e0 comprendre rapidement la structure du projet.<\/p>\n<h3>Strat\u00e9gie 3 : Politiques de cycle de vie automatis\u00e9es<\/h3>\n<p>Les transferts de fichiers manuels ne sont pas fiables. Les cadres de gestion de stockage hi\u00e9rarchiques automatis\u00e9s peuvent aider \u00e0 d\u00e9placer les donn\u00e9es entre les niveaux en toute s\u00e9curit\u00e9.<\/p>\n<ul>\n<li>Les politiques bas\u00e9es sur Chronos migrent des fichiers en fonction de leur \u00e2ge et de leur fr\u00e9quence d&rsquo;acc\u00e8s.<\/li>\n<li>Le hi\u00e9rarchisation des workflows relie le placement au stockage aux \u00e9tapes scientifiques du pipeline.<\/li>\n<li>Contr\u00f4les d&rsquo;int\u00e9grit\u00e9 automatis\u00e9s Utilisez des sommes de contr\u00f4le pour d\u00e9tecter la corruption des donn\u00e9es au fil du temps.<\/li>\n<\/ul>\n<p>Dans les centres HPC, des syst\u00e8mes tels que Just FZ J\u00fclich ou LRZ DSS assurent une hi\u00e9rarchisation automatis\u00e9e. Si vous g\u00e9rez des donn\u00e9es sur des clusters institutionnels, v\u00e9rifiez si votre centre propose des outils de gestion de stockage hi\u00e9rarchiques.<\/p>\n<h2>erreurs courantes et comment les \u00e9viter<\/h2>\n<h3>Erreur&nbsp;1&nbsp;: Stockage des donn\u00e9es sur les n\u0153uds de calcul<\/h3>\n<p>Cela se produit parce que c&rsquo;est pratique. Les donn\u00e9es sont g\u00e9n\u00e9r\u00e9es l\u00e0 o\u00f9 la simulation s&rsquo;ex\u00e9cute.<\/p>\n<p>Il \u00e9choue car le stockage de n\u0153ud de calcul est souvent \u00e9ph\u00e9m\u00e8re. Lorsque les n\u0153uds sont remplac\u00e9s, reformat\u00e9s ou mis hors service, les donn\u00e9es peuvent \u00eatre perdues. Ne traitez jamais le stockage de calcul comme un archive.<\/p>\n<p>Corrigez cela en \u00e9crivant la sortie directement sur un niveau de stockage d\u00e9sign\u00e9 lors de la simulation. Utilisez des E\/S parall\u00e8les si vous ex\u00e9cutez sur des syst\u00e8mes distribu\u00e9s.<\/p>\n<h3>Erreur&nbsp;2&nbsp;: surcompression lors d&rsquo;une utilisation active<\/h3>\n<p>Cela se produit parce que les \u00e9quipes veulent gagner de la place.<\/p>\n<p>Il \u00e9choue car les frais g\u00e9n\u00e9raux de d\u00e9compression peuvent ralentir l&rsquo;analyse. Pour les donn\u00e9es activement accessibles, la compression peut augmenter le temps de travail total.<\/p>\n<p>Corrigez cela en appliquant une compression principalement lors du transfert d&rsquo;archives. Gardez les copies actives non compress\u00e9es lorsque les performances sont importantes.<\/p>\n<h3>Erreur&nbsp;3&nbsp;: pas de convention de nommage<\/h3>\n<p>Cela se produit parce que tout le monde convient que la nomination est importante jusqu&rsquo;\u00e0 ce que quelqu&rsquo;un ait besoin de trouver un dossier de toute urgence.<\/p>\n<p>Il \u00e9choue parce que la d\u00e9nomination incoh\u00e9rente rend l&rsquo;automatisation fragile. Les scripts qui renomment, recherchent ou migrent des fichiers deviennent difficiles \u00e0 g\u00e9rer.<\/p>\n<p>Corrigez cela en adoptant une convention telle que <code>{project}_{quantity}_{resolution}_{time_step}.{extension}<\/code>. Par exemple : <code>bte_thermal_field_500x500_t0123.h5<\/code>.<\/p>\n<h3>Erreur&nbsp;4&nbsp;: supposer que la sauvegarde \u00e9quivaut \u00e0 la pr\u00e9servation<\/h3>\n<p>Cela se produit parce que les sauvegardes sont famili\u00e8res.<\/p>\n<p>Il \u00e9choue car les sauvegardes prot\u00e8gent contre la suppression accidentelle, mais elles ne r\u00e9solvent pas l&rsquo;obsolescence du format, la documentation incompl\u00e8te ou les d\u00e9pendances d&rsquo;acc\u00e8s interrompues.<\/p>\n<p>Corrigez cela en combinant des sauvegardes avec le d\u00e9p\u00f4t de r\u00e9f\u00e9rentiel, la documentation des m\u00e9tadonn\u00e9es et la normalisation des formats.<\/p>\n<h2>Cadre de d\u00e9cision : quoi stocker et quand<\/h2>\n<p>Toutes les donn\u00e9es ne m\u00e9ritent pas des ressources de stockage \u00e9gales. Utilisez ce cadre pour d\u00e9cider quoi conserver, o\u00f9 le conserver et pour combien de temps.<\/p>\n<table class=\"custom-table\">\n<tbody>\n<tr>\n<th>Type de donn\u00e9es<\/th>\n<th>Stockage recommand\u00e9<\/th>\n<th>R\u00e8gle de conservation<\/th>\n<th>Raison<\/th>\n<\/tr>\n<tr>\n<td>Fichiers d&rsquo;entr\u00e9e et scripts de configuration<\/td>\n<td>R\u00e9f\u00e9rentiel et archives contr\u00f4l\u00e9s par version<\/td>\n<td>conserver<\/td>\n<td>Ceux-ci permettent de reproduire les simulations<\/td>\n<\/tr>\n<tr>\n<td>Fichiers d&rsquo;environnement logiciel<\/td>\n<td>R\u00e9f\u00e9rentiel, registre de conteneurs ou archives<\/td>\n<td>conserver<\/td>\n<td>Ils documentent la fa\u00e7on dont le flux de travail a \u00e9t\u00e9 ex\u00e9cut\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Fichiers de point de contr\u00f4le bruts<\/td>\n<td>Niveau 0 lors de l&rsquo;ex\u00e9cution, puis niveau 1 ou niveau 2 de mani\u00e8re s\u00e9lective<\/td>\n<td>Ne conserver que les points de red\u00e9marrage critique<\/td>\n<td>Ils sont volumineux et souvent pas tous pertinents pour la publication<\/td>\n<\/tr>\n<tr>\n<td>r\u00e9sultats d\u00e9riv\u00e9s interm\u00e9diaires<\/td>\n<td>Niveau 1 lors de l&rsquo;analyse active<\/td>\n<td>Conserver pendant que le projet est actif<\/td>\n<td>Ils soutiennent l&rsquo;analyse mais peuvent souvent \u00eatre r\u00e9g\u00e9n\u00e9r\u00e9s<\/td>\n<\/tr>\n<tr>\n<td>Chiffres et tableaux publi\u00e9s<\/td>\n<td>D\u00e9p\u00f4t de d\u00e9p\u00f4t et archives de publication<\/td>\n<td>conserver<\/td>\n<td>Ils soutiennent le dossier publi\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Ensembles de donn\u00e9es s\u00e9lectionn\u00e9s pour la r\u00e9utilisation<\/td>\n<td>R\u00e9f\u00e9rentiel de domaines, Zenodo ou archive institutionnelle<\/td>\n<td>conserver<\/td>\n<td>Ils sont le r\u00e9sultat scientifique r\u00e9utilisable<\/td>\n<\/tr>\n<tr>\n<td>Sortie de d\u00e9bogage temporaire<\/td>\n<td>Stockage de scratch local ou de niveau 0<\/td>\n<td>Supprimer apr\u00e8s validation<\/td>\n<td>Il a une faible valeur scientifique \u00e0 long terme<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2>Une liste de contr\u00f4le pratique<\/h2>\n<p>Avant votre prochaine campagne de simulation, consultez cette liste de contr\u00f4le&nbsp;:<\/p>\n<ul>\n<li>[ ] R\u00e9digez un plan de gestion des donn\u00e9es qui estime le volume, s\u00e9lectionne les formats et d\u00e9finit les r\u00e8gles de r\u00e9tention.<\/li>\n<li>[ ] Choisissez les niveaux de stockage et les types de donn\u00e9es mappez les supports de stockage et les politiques de migration.<\/li>\n<li>[ ] Mettre en \u0153uvre des conventions de nommage coh\u00e9rentes et r\u00e9parables par la machine.<\/li>\n<li>[ ] Configurez la journalisation automatis\u00e9e de provenance pour les versions, les param\u00e8tres et les horodatages du logiciel.<\/li>\n<li>[ ] Configurez la documentation des m\u00e9tadonn\u00e9es avec des fichiers Lisez-moi, des dictionnaires de donn\u00e9es et des vocabulaires contr\u00f4l\u00e9s.<\/li>\n<li>[ ] V\u00e9rifiez une strat\u00e9gie de sauvegarde avec 3 copies, 2 types de supports et 1 copie hors site.<\/li>\n<li>[ ] D\u00e9p\u00f4t de r\u00e9f\u00e9rentiel de plan dans un r\u00e9f\u00e9rentiel sp\u00e9cifique \u00e0 un domaine, institutionnel ou \u00e0 usage g\u00e9n\u00e9ral.<\/li>\n<li>[ ] Testez la r\u00e9cup\u00e9ration en confirmant que les donn\u00e9es archiv\u00e9es sont accessibles sur un autre syst\u00e8me.<\/li>\n<\/ul>\n<h2>Liens internes et guides connexes<\/h2>\n<p>Comprendre la gestion des donn\u00e9es \u00e0 grande \u00e9chelle compl\u00e8te les autres sujets abord\u00e9s dans Matforge :<\/p>\n<ul>\n<li><a href=\"\/hdf5-for-simulation-data-parallel-io-long-term-storage\/\">HDF5 pour les donn\u00e9es de simulation<\/a> couvre les E\/S parall\u00e8les et les mod\u00e8les de stockage sp\u00e9cifiques au format.<\/li>\n<li><a href=\"\/reproducibility-and-its-role-in-debugging\/\">Reproductibilit\u00e9 et son r\u00f4le dans le d\u00e9bogage<\/a> explore le suivi de la provenance et les flux de travail reproductibles.<\/li>\n<li><a href=\"\/from-equations-to-simulations-the-modeling-pipeline\/\">des \u00e9quations aux simulations&nbsp;: le pipeline de mod\u00e9lisation<\/a> explique le flux de production de donn\u00e9es complet.<\/li>\n<li><a href=\"\/managing-large-scale-pde-problems-strategies-solvers-and-hpc-case-studies\/\">G\u00e9rer les probl\u00e8mes de PDE \u00e0 grande \u00e9chelle<\/a> aborde les strat\u00e9gies HPC lorsque les niveaux de stockage sont importants.<\/li>\n<\/ul>\n<h2>Recommandations : ce que nous ferions diff\u00e9remment<\/h2>\n<p>La plupart des chercheurs consid\u00e8rent la gestion des donn\u00e9es comme une r\u00e9flexion apr\u00e8s coup. Ces changements emp\u00eacheraient de nombreux probl\u00e8mes \u00e0 long terme :<\/p>\n<ol>\n<li>Commencez par un plan de gestion des donn\u00e9es. M\u00eame un document d&rsquo;une page avec des niveaux de stockage, des r\u00e8gles de r\u00e9tention et des normes de m\u00e9tadonn\u00e9es peut emp\u00eacher l&rsquo;effondrement organisationnel.<\/li>\n<li>Stockez les entr\u00e9es, pas seulement les sorties. L&rsquo;algorithme et les param\u00e8tres sont souvent plus durables que les t\u00e9raoctets des r\u00e9sultats de simulation.<\/li>\n<li>Utilisez des formats ouverts. HDF5 ou NETCDF est plus s\u00fbr que les fichiers binaires propri\u00e9taires pour une r\u00e9utilisation \u00e0 long terme.<\/li>\n<li>Documentez tout. Si vous ne pouvez pas expliquer ce que repr\u00e9sente un ensemble de donn\u00e9es dans un paragraphe, il n&rsquo;est pas vraiment utilisable.<\/li>\n<li>D\u00e9p\u00f4t dans les r\u00e9f\u00e9rentiels. Utilisez Zenodo, des archives sp\u00e9cifiques \u00e0 un domaine ou des r\u00e9f\u00e9rentiels institutionnels avec des identifiants persistants.<\/li>\n<\/ol>\n<p>La diff\u00e9rence entre des ensembles de donn\u00e9es mal g\u00e9r\u00e9s et bien g\u00e9r\u00e9s n&rsquo;est pas le co\u00fbt de stockage. C&rsquo;est la reproductibilit\u00e9. Une bonne gestion de l&rsquo;ensemble de donn\u00e9es transforme les sorties de fichiers temporaires en actifs de recherche permanents.<\/p>\n<h2>Conclusion<\/h2>\n<p>La gestion de jeux de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle n\u00e9cessite une strat\u00e9gie d\u00e9lib\u00e9r\u00e9e qui couvre le mat\u00e9riel, les m\u00e9tadonn\u00e9es, les mod\u00e8les d&rsquo;acc\u00e8s et la pr\u00e9servation.<\/p>\n<p>Le cadre est simple :<\/p>\n<ul>\n<li>Le stockage \u00e0 plusieurs niveaux optimise les performances et les co\u00fbts.<\/li>\n<li>Des principes \u00e9quitables soutiennent l&rsquo;utilit\u00e9 \u00e0 long terme.<\/li>\n<li>Les plans de gestion des donn\u00e9es emp\u00eachent le chaos organisationnel.<\/li>\n<li>Les m\u00e9tadonn\u00e9es et la provenance d\u00e9terminent si les donn\u00e9es survivent en tant que science r\u00e9utilisable.<\/li>\n<\/ul>\n<p>L&rsquo;alternative consiste \u00e0 stocker des donn\u00e9es l\u00e0 o\u00f9 elles sont pratiques et \u00e0 esp\u00e9rer qu&rsquo;elles survivront. Cela conduit souvent \u00e0 des ensembles de donn\u00e9es orphelins qui contribuent peu au domaine. Avec une strat\u00e9gie appropri\u00e9e, les r\u00e9sultats de la simulation peuvent devenir une infrastructure de recherche r\u00e9utilisable et r\u00e9utilisable.<\/p>\n<p>C&rsquo;est la diff\u00e9rence entre les fichiers temporaires et la science permanente.<\/p>\n<h2>Lectures compl\u00e9mentaires<\/h2>\n<ul>\n<li>Principes de la foire \u2014 GO Fair Initiative&nbsp;: <a href=\"https:\/\/www.go-fair.org\/fair-principles\/\">https:\/\/www.go-fair.org\/fair-principles\/<\/a><\/li>\n<li>Gestion des donn\u00e9es de recherche en science de la simulation \u2014 Flemisch et al., 2024&nbsp;: <a href=\"https:\/\/link.springer.com\/article\/10.1007\/s13222-024-00475-4\">https:\/\/link.springer.com\/article\/10.1007\/s13222-024-00475-4<\/a><\/li>\n<li>Dix r\u00e8gles simples pour une gestion efficace des donn\u00e9es de recherche \u2014 Hassenstein et al., 2025&nbsp;: <a href=\"https:\/\/pmc.ncbi.nlm.nih.gov\/articles\/PMC12685206\">https:\/\/pmc.ncbi.nlm.nih.gov\/articles\/PMC12685206<\/a><\/li>\n<li>Principes directeurs de l&rsquo;\u00e9quit\u00e9 \u2014 Wilkinson et al., Donn\u00e9es scientifiques&nbsp;: <a href=\"https:\/\/www.nature.com\/articles\/sdata201618\">https:\/\/www.nature.com\/articles\/sdata201618<\/a><\/li>\n<li>Gestion des donn\u00e9es de recherche NFDI4CHEM&nbsp;: <a\u00a00>https:\/\/nfdi4chem.de\/data-management-for-chemistry\/<\/a\u00a00><\/li>\n<\/ul>\n","protected":false,"raw":"<p>Vos sorties de simulation ne sont pas seulement des fichiers. Ce sont des atouts de recherche. Lorsqu'une ex\u00e9cution \u00e0 plusieurs n\u0153uds se termine et g\u00e9n\u00e8re des centaines de gigaoctets sur des milliers de pas de temps, vous ne produisez pas seulement des donn\u00e9es. Vous cr\u00e9ez des preuves scientifiques qui doivent survivre aux mises \u00e0 niveau mat\u00e9rielles, au roulement du personnel et aux migrations de stockage institutionnels.<\/p>\n<p>Ce guide explique comment structurer la gestion de l'ensemble de donn\u00e9es afin que votre travail reste accessible, reproductible et significatif des ann\u00e9es apr\u00e8s la fin de la campagne de simulation.<\/p>\n<h2>Points \u00e0 retenir cl\u00e9s<\/h2>\n<ul>\n<li>Le stockage en plusieurs niveaux s\u00e9pare les donn\u00e9es de calcul actives du stockage d'archives, optimisant les performances et les co\u00fbts.<\/li>\n<li>Des principes \u00e9quitables \u2013 accessibles, accessibles, interop\u00e9rables et r\u00e9utilisables \u2013 fournissent un cadre pratique pour la gestion \u00e0 long terme des donn\u00e9es scientifiques.<\/li>\n<li>Les plans de gestion des donn\u00e9es doivent \u00eatre r\u00e9dig\u00e9s avant les premi\u00e8res ex\u00e9cutions de simulation, et non apr\u00e8s que l'archive soit d\u00e9j\u00e0 pleine.<\/li>\n<li>Les m\u00e9tadonn\u00e9es et la provenance ne sont pas des extras optionnels. Ils d\u00e9terminent si les donn\u00e9es sont r\u00e9utilisables ou orphelines.<\/li>\n<\/ul>\n<h2>Le probl\u00e8me auquel vous \u00eates r\u00e9ellement confront\u00e9<\/h2>\n<p>Le principal probl\u00e8me n'est pas la capacit\u00e9 de stockage. C'est un effondrement organisationnel.<\/p>\n<p>Un projet typique de science des mat\u00e9riaux informatiques ou de dynamique des fluides g\u00e9n\u00e8re des donn\u00e9es dans plusieurs formats en plusieurs \u00e9tapes&nbsp;:<\/p>\n<ul>\n<li>Sortie de simulation brute, y compris les fichiers de point de contr\u00f4le, les vidages de diagnostic et les variables de champ.<\/li>\n<li>R\u00e9sultats interm\u00e9diaires, y compris les quantit\u00e9s post-trait\u00e9es, les valeurs d\u00e9riv\u00e9es et les donn\u00e9es pr\u00eates \u00e0 l'analyse.<\/li>\n<li>Donn\u00e9es publi\u00e9es finales, y compris les chiffres, les tableaux et les ensembles de donn\u00e9es suppl\u00e9mentaires s\u00e9lectionn\u00e9s.<\/li>\n<li>Artefacts reproductibles, y compris les fichiers d'entr\u00e9e, les scripts, les d\u00e9finitions d'environnement et les versions logicielles.<\/li>\n<\/ul>\n<p>Ce qui se passe ensuite d\u00e9termine si le projet devient un point de r\u00e9f\u00e9rence durable ou dispara\u00eet. De nombreux groupes de recherche g\u00e8rent cela mal pour plusieurs raisons :<\/p>\n<ol>\n<li>Les donn\u00e9es sont stock\u00e9es sur les n\u0153uds de calcul. Lorsqu'un cluster est mis \u00e0 niveau ou mis hors service, les donn\u00e9es peuvent dispara\u00eetre.<\/li>\n<li>Les m\u00e9tadonn\u00e9es sont absentes. Personne ne sait ce que repr\u00e9sente un ensemble de donn\u00e9es sans demander au chercheur d'origine.<\/li>\n<li>Il n'y a pas de plan de conservation. L'hypoth\u00e8se selon laquelle l'\u00e9quipe le sauvegardera plus tard \u00e9choue souvent.<\/li>\n<li>Les formats deviennent obsol\u00e8tes. Les formats binaires propri\u00e9taires peuvent d\u00e9pendre d'un package logiciel ou d'une version.<\/li>\n<\/ol>\n<p>C'est le principal d\u00e9fi. Une strat\u00e9gie de gestion d'ensemble de donn\u00e9es doit aborder l'\u00e9chelle, l'organisation, l'accessibilit\u00e9 et la long\u00e9vit\u00e9 en m\u00eame temps.<\/p>\n<h2>Architecture de stockage \u00e0 plusieurs niveaux : la fondation<\/h2>\n<p>Le stockage par niveau est l'\u00e9pine dorsale de la gestion des donn\u00e9es scientifiques. Au lieu de tout stocker sur le m\u00eame support, vous s\u00e9parez les donn\u00e9es \u00e0 travers des niveaux optimis\u00e9s pour diff\u00e9rents mod\u00e8les d'acc\u00e8s et profils de co\u00fbts.<\/p>\n<h3>Niveau&nbsp;0&nbsp;: stockage de calcul actif<\/h3>\n<p>Moyenne : SSD NVMe et syst\u00e8mes de fichiers parall\u00e8les tels que Lustre, IBM Spectrum Scale ou BEEGFS.<\/p>\n<p>Objectif : C'est l\u00e0 que les donn\u00e9es vivent pendant le calcul actif. Cela n\u00e9cessite :<\/p>\n<ul>\n<li>Bande passante \u00e9lev\u00e9e pour les E\/S distribu\u00e9es.<\/li>\n<li>Faible latence pour le red\u00e9marrage du point de contr\u00f4le et l'analyse en temps r\u00e9el.<\/li>\n<li>Basculement automatique pour r\u00e9duire le risque de perte de donn\u00e9es lors de d\u00e9faillances de n\u0153uds.<\/li>\n<\/ul>\n<p>Les donn\u00e9es appartiennent ici lorsque des fichiers sont activement \u00e9crits, lus ou modifi\u00e9s en ex\u00e9cutant des simulations et des travaux de post-traitement.<\/p>\n<p>Un pi\u00e8ge courant consiste \u00e0 traiter ce niveau comme un stockage permanent. Les syst\u00e8mes de niveau 0 sont con\u00e7us pour le d\u00e9bit, et non pour la durabilit\u00e9 \u00e0 long terme. Lorsque le cluster est remplac\u00e9, les donn\u00e9es laiss\u00e9es au niveau 0 peuvent \u00eatre perdues.<\/p>\n<h3>Niveau 1 : stockage de recherche primaire<\/h3>\n<p>Moyenne : baies de disque dur de haute capacit\u00e9 et stockage d'objets distribu\u00e9s.<\/p>\n<p>Objectif : Il s'agit de l'archive de travail. Les donn\u00e9es sont accessibles r\u00e9guli\u00e8rement pendant le cycle de vie du projet actif, mais elles ne n\u00e9cessitent pas de latence inf\u00e9rieure \u00e0 la milliseconde.<\/p>\n<p>Les donn\u00e9es appartiennent ici lorsqu'elles comprennent des cycles de simulation termin\u00e9s, des r\u00e9sultats d'analyse interm\u00e9diaire et des ensembles de donn\u00e9es activement utilis\u00e9s par les collaborateurs.<\/p>\n<p>Les mod\u00e8les d'acc\u00e8s communs incluent des lectures de fichiers complets, des requ\u00eates de m\u00e9tadonn\u00e9es et des sous-ensembles s\u00e9lectifs.<\/p>\n<p>Les meilleures pratiques comprennent :<\/p>\n<ul>\n<li>La migration automatis\u00e9e \u00e0 partir du niveau 0 une fois les op\u00e9rations d'\u00e9criture cessantes.<\/li>\n<li>Copie redondante apr\u00e8s 3 copies, r\u00e8gle de 2 types de supports.<\/li>\n<li>Contr\u00f4le de l'int\u00e9grit\u00e9 gr\u00e2ce \u00e0 des sommes de contr\u00f4le et \u00e0 la d\u00e9tection d'erreurs.<\/li>\n<\/ul>\n<h3>Niveau 2 : stockage frigorifique et archives<\/h3>\n<p>Support : stockage d'objets tels que S3 ou Azure BLOB, biblioth\u00e8ques de bandes et syst\u00e8mes d'archives approfondies.<\/p>\n<p>Objectif : Ce niveau prend en charge la pr\u00e9servation \u00e0 long terme. Les donn\u00e9es sont rarement accessibles mais doivent rester intactes pendant des ann\u00e9es ou des d\u00e9cennies.<\/p>\n<p>Les donn\u00e9es appartiennent ici lorsqu'elles comprennent des projets termin\u00e9s, des suppl\u00e9ments de publication, des d\u00e9p\u00f4ts de r\u00e9f\u00e9rentiel et des ensembles de donn\u00e9es datant de plus de plusieurs ann\u00e9es.<\/p>\n<p>Le niveau de conservation principal devrait \u00eatre immuable lorsque cela est possible. Les d\u00e9p\u00f4ts de stockage ou de r\u00e9f\u00e9rentiel en lecture seules permettent d'emp\u00eacher la suppression ou la modification accidentelle.<\/p>\n<h2>Le cycle de vie des donn\u00e9es : de la cr\u00e9ation \u00e0 la conservation<\/h2>\n<p>Comprendre comment les donn\u00e9es \u00e9voluent dans son cycle de vie vous aide \u00e0 choisir la bonne strat\u00e9gie \u00e0 chaque phase.<\/p>\n<h3>Phase 1 : Planifiez avant de courir<\/h3>\n<p>C'est l\u00e0 que de nombreux chercheurs \u00e9chouent. Vous avez besoin d'un plan de gestion des donn\u00e9es avant l'ex\u00e9cution de la premi\u00e8re simulation.<\/p>\n<p>Un plan de gestion des donn\u00e9es r\u00e9pond \u00e0 plusieurs questions pratiques :<\/p>\n<ul>\n<li>Quelles donn\u00e9es seront g\u00e9n\u00e9r\u00e9es et combien ?<\/li>\n<li>Quels formats stockeront les donn\u00e9es&nbsp;?<\/li>\n<li>Quels ensembles de donn\u00e9es sont essentiels et lesquels sont jetables ?<\/li>\n<li>O\u00f9 les donn\u00e9es seront-elles stock\u00e9es pendant la recherche active&nbsp;?<\/li>\n<li>Qui a acc\u00e8s et quand l'acc\u00e8s s'arr\u00eate-t-il&nbsp;?<\/li>\n<li>Comment les m\u00e9tadonn\u00e9es documenteront-elles les donn\u00e9es&nbsp;?<\/li>\n<\/ul>\n<p>Les outils recommand\u00e9s incluent DMPTool, RDMO ou le mod\u00e8le de gestion des donn\u00e9es de recherche de votre \u00e9tablissement. De nombreux bailleurs de fonds exigent d\u00e9sormais des plans de gestion des donn\u00e9es pour les demandes de subvention.<\/p>\n<h3>Phase 2 : Cr\u00e9ation et validation actives<\/h3>\n<p>Lors de l'ex\u00e9cution de la simulation, la gestion des donn\u00e9es se concentre sur plusieurs priorit\u00e9s&nbsp;:<\/p>\n<ul>\n<li>Int\u00e9grit\u00e9 en temps r\u00e9el. Valider les sorties imm\u00e9diatement apr\u00e8s la fin du point de contr\u00f4le.<\/li>\n<li>archivage s\u00e9lectif. N'archivez pas tout. Archivez ce qui est pertinent pour la publication ou scientifiquement pr\u00e9cieux.<\/li>\n<li>Provenance automatis\u00e9e. Enregistrez les versions des logiciels, les fichiers de param\u00e8tres et les environnements d'ex\u00e9cution \u00e0 c\u00f4t\u00e9 des donn\u00e9es.<\/li>\n<li>Conventions de nommage. Utilisez des noms de fichiers coh\u00e9rents et analys\u00e9s par la machine qui encodent la structure et activent l'automatisation.<\/li>\n<\/ul>\n<h3>Phase 3 : Analyse active et partage<\/h3>\n<p>Une fois les simulations termin\u00e9es et les donn\u00e9es migr\u00e9es vers le niveau&nbsp;1, l'accent est mis sur l'analyse et la collaboration.<\/p>\n<ul>\n<li>Utilisez des strat\u00e9gies de sous-ensemble. Stockez les donn\u00e9es afin de pouvoir lire des pas de temps individuels ou des r\u00e9gions spatiales sans charger des fichiers entiers. HDF5 et NETCDF prennent en charge cette fonction gr\u00e2ce \u00e0 des s\u00e9lections Hyperslab.<\/li>\n<li>Prenez soigneusement des d\u00e9cisions de compression. La compression sans perte peut r\u00e9duire les co\u00fbts de stockage d'archives, mais la d\u00e9compression utilise le temps CPU.<\/li>\n<li>Soutenir l'acc\u00e8s collaboratif Utilisez des montages en lecture seule ou des catalogues de donn\u00e9es s\u00e9lectionn\u00e9s au lieu de dupliquer des donn\u00e9es dans de nombreux r\u00e9pertoires.<\/li>\n<\/ul>\n<h3>Phase 4 : Pr\u00e9servation et partage<\/h3>\n<p>Une fois le projet termin\u00e9, l'objectif est de pr\u00e9server les donn\u00e9es sous une forme que d'autres chercheurs peuvent comprendre et r\u00e9utiliser.<\/p>\n<ul>\n<li>D\u00e9posez des ensembles de donn\u00e9es organis\u00e9es dans des r\u00e9f\u00e9rentiels sp\u00e9cifiques \u00e0 un domaine, des r\u00e9f\u00e9rentiels institutionnels ou des services tels que Zenodo.<\/li>\n<li>Obtenez des identifiants persistants tels que DOI afin que les donn\u00e9es puissent \u00eatre cit\u00e9es et trac\u00e9es.<\/li>\n<li>Ajoutez une licence lisible par machine telle que Creative Commons ou Open Data Commons.<\/li>\n<li>Incluez un package de documentation avec des fichiers Lisez-moi, des dictionnaires de donn\u00e9es et des descriptions de m\u00e9thodes.<\/li>\n<\/ul>\n<h2>Principes \u00e9quitables : le cadre<\/h2>\n<p>Les principes \u00e9quitables ne sont pas des slogans marketing. Ils sont une norme op\u00e9rationnelle pour la gestion des donn\u00e9es scientifiques et sont soutenus par les principaux bailleurs de fonds et les institutions.<\/p>\n<h3>introuvable<\/h3>\n<p>Les donn\u00e9es peuvent \u00eatre trouv\u00e9es lorsque&nbsp;:<\/p>\n<ol>\n<li>Il a un identifiant persistant, tel qu'un DOI ou un PID.<\/li>\n<li>Il est d\u00e9crit avec des m\u00e9tadonn\u00e9es riches, pas seulement des noms de fichiers.<\/li>\n<li>Les m\u00e9tadonn\u00e9es sont index\u00e9es dans des catalogues ou des r\u00e9f\u00e9rentiels consultables.<\/li>\n<\/ol>\n<p>Une impl\u00e9mentation pratique consiste \u00e0 enregistrer des ensembles de donn\u00e9es dans ZeNoDo ou dans un r\u00e9f\u00e9rentiel sp\u00e9cifique \u00e0 un domaine. Utilisez des vocabulaires contr\u00f4l\u00e9s pour des quantit\u00e9s physiques au lieu d'\u00e9tiquettes incoh\u00e9rentes telles que \"Temp\u00e9rature\", \"Temp\" et \"T_Field\".<\/p>\n<h3>accessible<\/h3>\n<p>Les donn\u00e9es sont accessibles lorsque :<\/p>\n<ol>\n<li>Il peut \u00eatre r\u00e9cup\u00e9r\u00e9 via des protocoles standard tels que HTTP, FTP ou une API S3.<\/li>\n<li>Les r\u00e8gles d'authentification et d'autorisation sont clairement d\u00e9finies.<\/li>\n<li>Les m\u00e9tadonn\u00e9es restent accessibles m\u00eame lorsque les donn\u00e9es brutes sont archiv\u00e9es.<\/li>\n<\/ol>\n<h3>interop\u00e9rable<\/h3>\n<p>L'interop\u00e9rabilit\u00e9 n\u00e9cessite :<\/p>\n<ol>\n<li>Formats ouverts et standardis\u00e9s tels que HDF5, NETCDF, CSV ou JSON.<\/li>\n<li>Vocabulaires communautaires reconnus par votre discipline.<\/li>\n<li>R\u00e9f\u00e9rences qualifi\u00e9es qui lient des donn\u00e9es \u00e0 des publications, des logiciels et des ensembles de donn\u00e9es connexes.<\/li>\n<\/ol>\n<h3>r\u00e9utilisable<\/h3>\n<p>La r\u00e9utilisation d\u00e9pend de :<\/p>\n<ol>\n<li>Documentation claire de provenance des donn\u00e9es brutes aux chiffres publi\u00e9s.<\/li>\n<li>Licence explicite qui explique ce que les autres peuvent faire avec les donn\u00e9es.<\/li>\n<li>Conformit\u00e9 aux normes communautaires et aux sch\u00e9mas de m\u00e9tadonn\u00e9es sp\u00e9cifiques au domaine.<\/li>\n<\/ol>\n<p>Pour les donn\u00e9es de simulation, les r\u00e9f\u00e9rentiels sp\u00e9cifiques \u00e0 un domaine peuvent \u00eatre particuli\u00e8rement utiles. Par exemple, NOMAD fournit une infrastructure conforme \u00e0 la norme pour la science des mat\u00e9riaux informatiques. Si votre travail implique une dynamique mol\u00e9culaire, une mod\u00e9lisation en champ de phase ou un champ connexe, v\u00e9rifiez si un r\u00e9f\u00e9rentiel de domaine existe.<\/p>\n<h2>M\u00e9tadonn\u00e9es et provenance&nbsp;: ce qui compte r\u00e9ellement<\/h2>\n<p>Les m\u00e9tadonn\u00e9es sont l'un des points de d\u00e9faillance les plus courants dans la gestion des donn\u00e9es scientifiques. Un ensemble de donn\u00e9es sans m\u00e9tadonn\u00e9es ne sont pas des donn\u00e9es r\u00e9utilisables. C'est un myst\u00e8re.<\/p>\n<h3>Champs de m\u00e9tadonn\u00e9es essentiels<\/h3>\n<table class=\"custom-table\">\n<tbody><tr>\n<th>Champ de m\u00e9tadonn\u00e9es<\/th>\n<th>Ce qu'il devrait capturer<\/th>\n<th>Pourquoi c'est important<\/th>\n<\/tr>\n<tr>\n<td>Nom du projet<\/td>\n<td>Identificateur de projet de recherche, de subvention ou de campagne<\/td>\n<td>Connecte l'ensemble de donn\u00e9es \u00e0 son contexte scientifique<\/td>\n<\/tr>\n<tr>\n<td>Objectif de simulation<\/td>\n<td>Question, hypoth\u00e8se ou benchmark test\u00e9<\/td>\n<td>Explique pourquoi l'ensemble de donn\u00e9es existe<\/td>\n<\/tr>\n<tr>\n<td>Param\u00e8tres d'entr\u00e9e<\/td>\n<td>Fichiers de configuration, plages de param\u00e8tres, graines al\u00e9atoires, conditions aux limites<\/td>\n<td>Prend en charge la reproductibilit\u00e9 et les rediffusions<\/td>\n<\/tr>\n<tr>\n<td>Environnement logiciel<\/td>\n<td>Version du solveur, d\u00e9pendances, compilateur, image de conteneur, syst\u00e8me d'exploitation<\/td>\n<td>Emp\u00eache l'ambigu\u00eft\u00e9 de l'environnement<\/td>\n<\/tr>\n<tr>\n<td>Format des donn\u00e9es<\/td>\n<td>Type de fichier, sch\u00e9ma, unit\u00e9s, syst\u00e8me de coordonn\u00e9es, m\u00e9thode de compression<\/td>\n<td>Aide d'autres outils \u00e0 lire et \u00e0 interpr\u00e9ter les donn\u00e9es<\/td>\n<\/tr>\n<tr>\n<td>Provenance<\/td>\n<td>Ligne de commande, \u00e9tape de workflow, version de script, commit git<\/td>\n<td>Trace comment les sorties ont \u00e9t\u00e9 g\u00e9n\u00e9r\u00e9es<\/td>\n<\/tr>\n<tr>\n<td>Propri\u00e9t\u00e9 et acc\u00e8s<\/td>\n<td>Cr\u00e9ateur, laboratoire, institution, droits d'acc\u00e8s, statut d'embargo<\/td>\n<td>Clarifie la responsabilit\u00e9 et r\u00e9utilise les r\u00e8gles<\/td>\n<\/tr>\n<tr>\n<td>Licence<\/td>\n<td>R\u00e9utiliser des termes tels que CC BY, CC0 ou une autre licence<\/td>\n<td>Permet aux autres de r\u00e9utiliser les donn\u00e9es l\u00e9galement<\/td>\n<\/tr>\n<\/tbody><\/table>\n<h3>Strat\u00e9gies de suivi de provenance<\/h3>\n<p>Une approche l\u00e9g\u00e8re consiste \u00e0 stocker un fichier de m\u00e9tadonn\u00e9es JSON \u00e0 c\u00f4t\u00e9 de chaque ensemble de donn\u00e9es. Il doit contenir des param\u00e8tres d'ex\u00e9cution, des versions de logiciels et une r\u00e9f\u00e9rence au fichier d'entr\u00e9e.<\/p>\n<p>Une approche plus robuste consiste \u00e0 utiliser des cadres de suivi de provenance tels que Dagman, Workflow-NG ou MyExperiment pour enregistrer automatiquement chaque \u00e9tape de calcul, fichier d'entr\u00e9e et appel logiciel.<\/p>\n<p>La meilleure pratique est simple : enregistrez la ligne de commande exacte utilis\u00e9e pour ex\u00e9cuter la simulation. Il s'agit souvent de l'artefact de provenance le plus important.<\/p>\n<h2>Strat\u00e9gies de stockage qui fonctionnent r\u00e9ellement<\/h2>\n<h3>Strat\u00e9gie&nbsp;1&nbsp;: Pr\u00e9servation des entr\u00e9es-premi\u00e8res<\/h3>\n<p>Au lieu d'archiver des t\u00e9raoctets de sortie brute, conservez l'algorithme de g\u00e9n\u00e9ration de donn\u00e9es et ses entr\u00e9es. Si vous pouvez reproduire la simulation, les sorties peuvent \u00eatre d\u00e9riv\u00e9es.<\/p>\n<p>Utilisez cette strat\u00e9gie pour les balayages de param\u00e8tres, les \u00e9tudes de validation et le d\u00e9veloppement d'algorithmes o\u00f9 la contribution scientifique est la m\u00e9thodologie plut\u00f4t que chaque fichier de sortie individuel.<\/p>\n<p>Pour l'impl\u00e9menter, archiver les fichiers d'entr\u00e9e, les scripts de configuration et une proc\u00e9dure de reproduction document\u00e9e. Stockez les sorties de mani\u00e8re s\u00e9lective. Gardez des cas repr\u00e9sentatifs et d\u00e9placez le reste vers des niveaux \u00e0 moindre co\u00fbt si n\u00e9cessaire.<\/p>\n<h3>Strat\u00e9gie 2 : organisation hi\u00e9rarchique par question scientifique<\/h3>\n<p>Structure de stockage pour correspondre \u00e0 la logique de recherche, et non seulement au flux de travail de calcul.<\/p>\n<pre><code>project_name\/\n\u251c\u2500\u2500 00_methods\/\n\u2502   \u251c\u2500\u2500 grid_setup\/\n\u2502   \u251c\u2500\u2500 boundary_conditions\/\n\u2502   \u2514\u2500\u2500 solver_configuration\/\n\u251c\u2500\u2500 01_reference_solutions\/\n\u2502   \u251c\u2500\u2500 analytical\/\n\u2502   \u2514\u2500\u2500 benchmark\/\n\u251c\u2500\u2500 02_parameter_sweeps\/\n\u2502   \u251c\u2500\u2500 sweep_1_conductivity\/\n\u2502   \u251c\u2500\u2500 sweep_2_temperature\/\n\u2502   \u2514\u2500\u2500 sweep_3_pressure\/\n\u251c\u2500\u2500 03_published_results\/\n\u2502   \u251c\u2500\u2500 figures\/\n\u2502   \u251c\u2500\u2500 supplementary\/\n\u2502   \u2514\u2500\u2500 manuscript_data\/\n\u2514\u2500\u2500 metadata\/\n    \u251c\u2500\u2500 README.md\n    \u251c\u2500\u2500 data_dictionary.csv\n    \u2514\u2500\u2500 run_log.csv\n<\/code><\/pre>\n<p>Cette organisation vous aide \u00e0 trouver des ensembles de donn\u00e9es sans recherche et aide les nouveaux membres \u00e0 comprendre rapidement la structure du projet.<\/p>\n<h3>Strat\u00e9gie 3 : Politiques de cycle de vie automatis\u00e9es<\/h3>\n<p>Les transferts de fichiers manuels ne sont pas fiables. Les cadres de gestion de stockage hi\u00e9rarchiques automatis\u00e9s peuvent aider \u00e0 d\u00e9placer les donn\u00e9es entre les niveaux en toute s\u00e9curit\u00e9.<\/p>\n<ul>\n<li>Les politiques bas\u00e9es sur Chronos migrent des fichiers en fonction de leur \u00e2ge et de leur fr\u00e9quence d'acc\u00e8s.<\/li>\n<li>Le hi\u00e9rarchisation des workflows relie le placement au stockage aux \u00e9tapes scientifiques du pipeline.<\/li>\n<li>Contr\u00f4les d'int\u00e9grit\u00e9 automatis\u00e9s Utilisez des sommes de contr\u00f4le pour d\u00e9tecter la corruption des donn\u00e9es au fil du temps.<\/li>\n<\/ul>\n<p>Dans les centres HPC, des syst\u00e8mes tels que Just FZ J\u00fclich ou LRZ DSS assurent une hi\u00e9rarchisation automatis\u00e9e. Si vous g\u00e9rez des donn\u00e9es sur des clusters institutionnels, v\u00e9rifiez si votre centre propose des outils de gestion de stockage hi\u00e9rarchiques.<\/p>\n<h2>erreurs courantes et comment les \u00e9viter<\/h2>\n<h3>Erreur&nbsp;1&nbsp;: Stockage des donn\u00e9es sur les n\u0153uds de calcul<\/h3>\n<p>Cela se produit parce que c'est pratique. Les donn\u00e9es sont g\u00e9n\u00e9r\u00e9es l\u00e0 o\u00f9 la simulation s'ex\u00e9cute.<\/p>\n<p>Il \u00e9choue car le stockage de n\u0153ud de calcul est souvent \u00e9ph\u00e9m\u00e8re. Lorsque les n\u0153uds sont remplac\u00e9s, reformat\u00e9s ou mis hors service, les donn\u00e9es peuvent \u00eatre perdues. Ne traitez jamais le stockage de calcul comme un archive.<\/p>\n<p>Corrigez cela en \u00e9crivant la sortie directement sur un niveau de stockage d\u00e9sign\u00e9 lors de la simulation. Utilisez des E\/S parall\u00e8les si vous ex\u00e9cutez sur des syst\u00e8mes distribu\u00e9s.<\/p>\n<h3>Erreur&nbsp;2&nbsp;: surcompression lors d'une utilisation active<\/h3>\n<p>Cela se produit parce que les \u00e9quipes veulent gagner de la place.<\/p>\n<p>Il \u00e9choue car les frais g\u00e9n\u00e9raux de d\u00e9compression peuvent ralentir l'analyse. Pour les donn\u00e9es activement accessibles, la compression peut augmenter le temps de travail total.<\/p>\n<p>Corrigez cela en appliquant une compression principalement lors du transfert d'archives. Gardez les copies actives non compress\u00e9es lorsque les performances sont importantes.<\/p>\n<h3>Erreur&nbsp;3&nbsp;: pas de convention de nommage<\/h3>\n<p>Cela se produit parce que tout le monde convient que la nomination est importante jusqu'\u00e0 ce que quelqu'un ait besoin de trouver un dossier de toute urgence.<\/p>\n<p>Il \u00e9choue parce que la d\u00e9nomination incoh\u00e9rente rend l'automatisation fragile. Les scripts qui renomment, recherchent ou migrent des fichiers deviennent difficiles \u00e0 g\u00e9rer.<\/p>\n<p>Corrigez cela en adoptant une convention telle que <code>{project}_{quantity}_{resolution}_{time_step}.{extension}<\/code>. Par exemple : <code>bte_thermal_field_500x500_t0123.h5<\/code>.<\/p>\n<h3>Erreur&nbsp;4&nbsp;: supposer que la sauvegarde \u00e9quivaut \u00e0 la pr\u00e9servation<\/h3>\n<p>Cela se produit parce que les sauvegardes sont famili\u00e8res.<\/p>\n<p>Il \u00e9choue car les sauvegardes prot\u00e8gent contre la suppression accidentelle, mais elles ne r\u00e9solvent pas l'obsolescence du format, la documentation incompl\u00e8te ou les d\u00e9pendances d'acc\u00e8s interrompues.<\/p>\n<p>Corrigez cela en combinant des sauvegardes avec le d\u00e9p\u00f4t de r\u00e9f\u00e9rentiel, la documentation des m\u00e9tadonn\u00e9es et la normalisation des formats.<\/p>\n<h2>Cadre de d\u00e9cision : quoi stocker et quand<\/h2>\n<p>Toutes les donn\u00e9es ne m\u00e9ritent pas des ressources de stockage \u00e9gales. Utilisez ce cadre pour d\u00e9cider quoi conserver, o\u00f9 le conserver et pour combien de temps.<\/p>\n<table class=\"custom-table\">\n<tbody><tr>\n<th>Type de donn\u00e9es<\/th>\n<th>Stockage recommand\u00e9<\/th>\n<th>R\u00e8gle de conservation<\/th>\n<th>Raison<\/th>\n<\/tr>\n<tr>\n<td>Fichiers d'entr\u00e9e et scripts de configuration<\/td>\n<td>R\u00e9f\u00e9rentiel et archives contr\u00f4l\u00e9s par version<\/td>\n<td>conserver<\/td>\n<td>Ceux-ci permettent de reproduire les simulations<\/td>\n<\/tr>\n<tr>\n<td>Fichiers d'environnement logiciel<\/td>\n<td>R\u00e9f\u00e9rentiel, registre de conteneurs ou archives<\/td>\n<td>conserver<\/td>\n<td>Ils documentent la fa\u00e7on dont le flux de travail a \u00e9t\u00e9 ex\u00e9cut\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Fichiers de point de contr\u00f4le bruts<\/td>\n<td>Niveau 0 lors de l'ex\u00e9cution, puis niveau 1 ou niveau 2 de mani\u00e8re s\u00e9lective<\/td>\n<td>Ne conserver que les points de red\u00e9marrage critique<\/td>\n<td>Ils sont volumineux et souvent pas tous pertinents pour la publication<\/td>\n<\/tr>\n<tr>\n<td>r\u00e9sultats d\u00e9riv\u00e9s interm\u00e9diaires<\/td>\n<td>Niveau 1 lors de l'analyse active<\/td>\n<td>Conserver pendant que le projet est actif<\/td>\n<td>Ils soutiennent l'analyse mais peuvent souvent \u00eatre r\u00e9g\u00e9n\u00e9r\u00e9s<\/td>\n<\/tr>\n<tr>\n<td>Chiffres et tableaux publi\u00e9s<\/td>\n<td>D\u00e9p\u00f4t de d\u00e9p\u00f4t et archives de publication<\/td>\n<td>conserver<\/td>\n<td>Ils soutiennent le dossier publi\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Ensembles de donn\u00e9es s\u00e9lectionn\u00e9s pour la r\u00e9utilisation<\/td>\n<td>R\u00e9f\u00e9rentiel de domaines, Zenodo ou archive institutionnelle<\/td>\n<td>conserver<\/td>\n<td>Ils sont le r\u00e9sultat scientifique r\u00e9utilisable<\/td>\n<\/tr>\n<tr>\n<td>Sortie de d\u00e9bogage temporaire<\/td>\n<td>Stockage de scratch local ou de niveau 0<\/td>\n<td>Supprimer apr\u00e8s validation<\/td>\n<td>Il a une faible valeur scientifique \u00e0 long terme<\/td>\n<\/tr>\n<\/tbody><\/table>\n<h2>Une liste de contr\u00f4le pratique<\/h2>\n<p>Avant votre prochaine campagne de simulation, consultez cette liste de contr\u00f4le&nbsp;:<\/p>\n<ul>\n<li>[ ] R\u00e9digez un plan de gestion des donn\u00e9es qui estime le volume, s\u00e9lectionne les formats et d\u00e9finit les r\u00e8gles de r\u00e9tention.<\/li>\n<li>[ ] Choisissez les niveaux de stockage et les types de donn\u00e9es mappez les supports de stockage et les politiques de migration.<\/li>\n<li>[ ] Mettre en \u0153uvre des conventions de nommage coh\u00e9rentes et r\u00e9parables par la machine.<\/li>\n<li>[ ] Configurez la journalisation automatis\u00e9e de provenance pour les versions, les param\u00e8tres et les horodatages du logiciel.<\/li>\n<li>[ ] Configurez la documentation des m\u00e9tadonn\u00e9es avec des fichiers Lisez-moi, des dictionnaires de donn\u00e9es et des vocabulaires contr\u00f4l\u00e9s.<\/li>\n<li>[ ] V\u00e9rifiez une strat\u00e9gie de sauvegarde avec 3 copies, 2 types de supports et 1 copie hors site.<\/li>\n<li>[ ] D\u00e9p\u00f4t de r\u00e9f\u00e9rentiel de plan dans un r\u00e9f\u00e9rentiel sp\u00e9cifique \u00e0 un domaine, institutionnel ou \u00e0 usage g\u00e9n\u00e9ral.<\/li>\n<li>[ ] Testez la r\u00e9cup\u00e9ration en confirmant que les donn\u00e9es archiv\u00e9es sont accessibles sur un autre syst\u00e8me.<\/li>\n<\/ul>\n<h2>Liens internes et guides connexes<\/h2>\n<p>Comprendre la gestion des donn\u00e9es \u00e0 grande \u00e9chelle compl\u00e8te les autres sujets abord\u00e9s dans Matforge :<\/p>\n<ul>\n<li><a href=\"\/hdf5-for-simulation-data-parallel-io-long-term-storage\/\">HDF5 pour les donn\u00e9es de simulation<\/a> couvre les E\/S parall\u00e8les et les mod\u00e8les de stockage sp\u00e9cifiques au format.<\/li>\n<li><a href=\"\/reproducibility-and-its-role-in-debugging\/\">Reproductibilit\u00e9 et son r\u00f4le dans le d\u00e9bogage<\/a> explore le suivi de la provenance et les flux de travail reproductibles.<\/li>\n<li><a href=\"\/from-equations-to-simulations-the-modeling-pipeline\/\">des \u00e9quations aux simulations&nbsp;: le pipeline de mod\u00e9lisation<\/a> explique le flux de production de donn\u00e9es complet.<\/li>\n<li><a href=\"\/managing-large-scale-pde-problems-strategies-solvers-and-hpc-case-studies\/\">G\u00e9rer les probl\u00e8mes de PDE \u00e0 grande \u00e9chelle<\/a> aborde les strat\u00e9gies HPC lorsque les niveaux de stockage sont importants.<\/li>\n<\/ul>\n<h2>Recommandations : ce que nous ferions diff\u00e9remment<\/h2>\n<p>La plupart des chercheurs consid\u00e8rent la gestion des donn\u00e9es comme une r\u00e9flexion apr\u00e8s coup. Ces changements emp\u00eacheraient de nombreux probl\u00e8mes \u00e0 long terme :<\/p>\n<ol>\n<li>Commencez par un plan de gestion des donn\u00e9es. M\u00eame un document d'une page avec des niveaux de stockage, des r\u00e8gles de r\u00e9tention et des normes de m\u00e9tadonn\u00e9es peut emp\u00eacher l'effondrement organisationnel.<\/li>\n<li>Stockez les entr\u00e9es, pas seulement les sorties. L'algorithme et les param\u00e8tres sont souvent plus durables que les t\u00e9raoctets des r\u00e9sultats de simulation.<\/li>\n<li>Utilisez des formats ouverts. HDF5 ou NETCDF est plus s\u00fbr que les fichiers binaires propri\u00e9taires pour une r\u00e9utilisation \u00e0 long terme.<\/li>\n<li>Documentez tout. Si vous ne pouvez pas expliquer ce que repr\u00e9sente un ensemble de donn\u00e9es dans un paragraphe, il n'est pas vraiment utilisable.<\/li>\n<li>D\u00e9p\u00f4t dans les r\u00e9f\u00e9rentiels. Utilisez Zenodo, des archives sp\u00e9cifiques \u00e0 un domaine ou des r\u00e9f\u00e9rentiels institutionnels avec des identifiants persistants.<\/li>\n<\/ol>\n<p>La diff\u00e9rence entre des ensembles de donn\u00e9es mal g\u00e9r\u00e9s et bien g\u00e9r\u00e9s n'est pas le co\u00fbt de stockage. C'est la reproductibilit\u00e9. Une bonne gestion de l'ensemble de donn\u00e9es transforme les sorties de fichiers temporaires en actifs de recherche permanents.<\/p>\n<h2>Conclusion<\/h2>\n<p>La gestion de jeux de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle n\u00e9cessite une strat\u00e9gie d\u00e9lib\u00e9r\u00e9e qui couvre le mat\u00e9riel, les m\u00e9tadonn\u00e9es, les mod\u00e8les d'acc\u00e8s et la pr\u00e9servation.<\/p>\n<p>Le cadre est simple :<\/p>\n<ul>\n<li>Le stockage \u00e0 plusieurs niveaux optimise les performances et les co\u00fbts.<\/li>\n<li>Des principes \u00e9quitables soutiennent l'utilit\u00e9 \u00e0 long terme.<\/li>\n<li>Les plans de gestion des donn\u00e9es emp\u00eachent le chaos organisationnel.<\/li>\n<li>Les m\u00e9tadonn\u00e9es et la provenance d\u00e9terminent si les donn\u00e9es survivent en tant que science r\u00e9utilisable.<\/li>\n<\/ul>\n<p>L'alternative consiste \u00e0 stocker des donn\u00e9es l\u00e0 o\u00f9 elles sont pratiques et \u00e0 esp\u00e9rer qu'elles survivront. Cela conduit souvent \u00e0 des ensembles de donn\u00e9es orphelins qui contribuent peu au domaine. Avec une strat\u00e9gie appropri\u00e9e, les r\u00e9sultats de la simulation peuvent devenir une infrastructure de recherche r\u00e9utilisable et r\u00e9utilisable.<\/p>\n<p>C'est la diff\u00e9rence entre les fichiers temporaires et la science permanente.<\/p>\n<h2>Lectures compl\u00e9mentaires<\/h2>\n<ul>\n<li>Principes de la foire \u2014 GO Fair Initiative&nbsp;: <a href=\"https:\/\/www.go-fair.org\/fair-principles\/\">https:\/\/www.go-fair.org\/fair-principles\/<\/a><\/li>\n<li>Gestion des donn\u00e9es de recherche en science de la simulation \u2014 Flemisch et al., 2024&nbsp;: <a href=\"https:\/\/link.springer.com\/article\/10.1007\/s13222-024-00475-4\">https:\/\/link.springer.com\/article\/10.1007\/s13222-024-00475-4<\/a><\/li>\n<li>Dix r\u00e8gles simples pour une gestion efficace des donn\u00e9es de recherche \u2014 Hassenstein et al., 2025&nbsp;: <a href=\"https:\/\/pmc.ncbi.nlm.nih.gov\/articles\/PMC12685206\">https:\/\/pmc.ncbi.nlm.nih.gov\/articles\/PMC12685206<\/a><\/li>\n<li>Principes directeurs de l'\u00e9quit\u00e9 \u2014 Wilkinson et al., Donn\u00e9es scientifiques&nbsp;: <a href=\"https:\/\/www.nature.com\/articles\/sdata201618\">https:\/\/www.nature.com\/articles\/sdata201618<\/a><\/li>\n<li>Gestion des donn\u00e9es de recherche NFDI4CHEM&nbsp;: <a\u00a00>https:\/\/nfdi4chem.de\/data-management-for-chemistry\/<\/a\u00a00><\/li>\n<\/ul>\n"},"excerpt":{"rendered":"<p><span class=\"span-reading-time rt-reading-time\" style=\"display: block;\"><span class=\"rt-label rt-prefix\">Reading Time: <\/span> <span class=\"rt-time\"> 12<\/span> <span class=\"rt-label rt-postfix\">minutes<\/span><\/span>Vos sorties de simulation ne sont pas seulement des fichiers. Ce sont des atouts de recherche. Lorsqu&rsquo;une ex\u00e9cution \u00e0 plusieurs n\u0153uds se termine et g\u00e9n\u00e8re des centaines de gigaoctets sur des milliers de pas de temps, vous ne produisez pas seulement des donn\u00e9es. Vous cr\u00e9ez des preuves scientifiques qui doivent survivre aux mises \u00e0 niveau [&hellip;]<\/p>\n","protected":false,"raw":""},"author":2,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_locale":"fr_FR","_original_post":"https:\/\/matforge.org\/?p=385","iawp_total_views":0,"footnotes":""},"categories":[1],"tags":[],"class_list":["post-1247","post","type-post","status-publish","format-standard","hentry","category-simulation-modeling-projects","fr-FR"],"yoast_head":"<!-- This site is optimized with the Yoast SEO plugin v28.3 - https:\/\/yoast.com\/product\/yoast-seo-wordpress\/ -->\n<title>Gestion de jeux de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle<\/title>\n<meta name=\"description\" content=\"Apprenez les strat\u00e9gies de stockage pour les ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle, notamment le stockage \u00e0 plusieurs niveaux, les principes \u00e9quitables, les m\u00e9tadonn\u00e9es, la provenance et la conservation \u00e0 long terme.\" \/>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/\" \/>\n<meta property=\"og:locale\" content=\"fr_FR\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"Gestion de jeux de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle\" \/>\n<meta property=\"og:description\" content=\"Apprenez les strat\u00e9gies de stockage pour les ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle, notamment le stockage \u00e0 plusieurs niveaux, les principes \u00e9quitables, les m\u00e9tadonn\u00e9es, la provenance et la conservation \u00e0 long terme.\" \/>\n<meta property=\"og:url\" content=\"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/\" \/>\n<meta property=\"og:site_name\" content=\"matforge.org\" \/>\n<meta property=\"article:published_time\" content=\"2026-08-21T14:28:32+00:00\" \/>\n<meta name=\"author\" content=\"Elena Markovska\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:label1\" content=\"\u00c9crit par\" \/>\n\t<meta name=\"twitter:data1\" content=\"Elena Markovska\" \/>\n\t<meta name=\"twitter:label2\" content=\"Dur\u00e9e de lecture estim\u00e9e\" \/>\n\t<meta name=\"twitter:data2\" content=\"20 minutes\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"Article\",\"@id\":\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/#article\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/\"},\"author\":{\"name\":\"Elena Markovska\",\"@id\":\"https:\\\/\\\/matforge.org\\\/#\\\/schema\\\/person\\\/980162bb5de46742daece973661d93da\"},\"headline\":\"G\u00e9rer des ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle : strat\u00e9gies de stockage pour la recherche \u00e0 long terme\",\"datePublished\":\"2026-08-21T14:28:32+00:00\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/\"},\"wordCount\":4023,\"commentCount\":0,\"articleSection\":[\"Simulation &amp; Projets de mod\u00e9lisation\"],\"inLanguage\":\"fr-FR\",\"potentialAction\":[{\"@type\":\"CommentAction\",\"name\":\"Comment\",\"target\":[\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/#respond\"]}]},{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/\",\"url\":\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/\",\"name\":\"Gestion de jeux de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/matforge.org\\\/#website\"},\"datePublished\":\"2026-08-21T14:28:32+00:00\",\"author\":{\"@id\":\"https:\\\/\\\/matforge.org\\\/#\\\/schema\\\/person\\\/980162bb5de46742daece973661d93da\"},\"description\":\"Apprenez les strat\u00e9gies de stockage pour les ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle, notamment le stockage \u00e0 plusieurs niveaux, les principes \u00e9quitables, les m\u00e9tadonn\u00e9es, la provenance et la conservation \u00e0 long terme.\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/#breadcrumb\"},\"inLanguage\":\"fr-FR\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/\"]}]},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/matforge.org\\\/fr\\\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/matforge.org\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"G\u00e9rer des ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle : strat\u00e9gies de stockage pour la recherche \u00e0 long terme\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/matforge.org\\\/#website\",\"url\":\"https:\\\/\\\/matforge.org\\\/\",\"name\":\"matforge.org\",\"description\":\"\",\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/matforge.org\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"fr-FR\"},{\"@type\":\"Person\",\"@id\":\"https:\\\/\\\/matforge.org\\\/#\\\/schema\\\/person\\\/980162bb5de46742daece973661d93da\",\"name\":\"Elena Markovska\",\"image\":{\"@type\":\"ImageObject\",\"inLanguage\":\"fr-FR\",\"@id\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/2de4e35b6581d7d8a839335156c6b5834cfaa0aef537a1c837e882dc57eea1e7?s=96&d=mm&r=g\",\"url\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/2de4e35b6581d7d8a839335156c6b5834cfaa0aef537a1c837e882dc57eea1e7?s=96&d=mm&r=g\",\"contentUrl\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/2de4e35b6581d7d8a839335156c6b5834cfaa0aef537a1c837e882dc57eea1e7?s=96&d=mm&r=g\",\"caption\":\"Elena Markovska\"},\"sameAs\":[\"http:\\\/\\\/matforge.org\"],\"url\":\"https:\\\/\\\/matforge.org\\\/author\\\/elena-markovska\\\/\"}]}<\/script>\n<!-- \/ Yoast SEO plugin. -->","yoast_head_json":{"title":"Gestion de jeux de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle","description":"Apprenez les strat\u00e9gies de stockage pour les ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle, notamment le stockage \u00e0 plusieurs niveaux, les principes \u00e9quitables, les m\u00e9tadonn\u00e9es, la provenance et la conservation \u00e0 long terme.","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/","og_locale":"fr_FR","og_type":"article","og_title":"Gestion de jeux de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle","og_description":"Apprenez les strat\u00e9gies de stockage pour les ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle, notamment le stockage \u00e0 plusieurs niveaux, les principes \u00e9quitables, les m\u00e9tadonn\u00e9es, la provenance et la conservation \u00e0 long terme.","og_url":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/","og_site_name":"matforge.org","article_published_time":"2026-08-21T14:28:32+00:00","author":"Elena Markovska","twitter_card":"summary_large_image","twitter_misc":{"\u00c9crit par":"Elena Markovska","Dur\u00e9e de lecture estim\u00e9e":"20 minutes"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"Article","@id":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/#article","isPartOf":{"@id":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/"},"author":{"name":"Elena Markovska","@id":"https:\/\/matforge.org\/#\/schema\/person\/980162bb5de46742daece973661d93da"},"headline":"G\u00e9rer des ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle : strat\u00e9gies de stockage pour la recherche \u00e0 long terme","datePublished":"2026-08-21T14:28:32+00:00","mainEntityOfPage":{"@id":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/"},"wordCount":4023,"commentCount":0,"articleSection":["Simulation &amp; Projets de mod\u00e9lisation"],"inLanguage":"fr-FR","potentialAction":[{"@type":"CommentAction","name":"Comment","target":["https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/#respond"]}]},{"@type":"WebPage","@id":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/","url":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/","name":"Gestion de jeux de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle","isPartOf":{"@id":"https:\/\/matforge.org\/#website"},"datePublished":"2026-08-21T14:28:32+00:00","author":{"@id":"https:\/\/matforge.org\/#\/schema\/person\/980162bb5de46742daece973661d93da"},"description":"Apprenez les strat\u00e9gies de stockage pour les ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle, notamment le stockage \u00e0 plusieurs niveaux, les principes \u00e9quitables, les m\u00e9tadonn\u00e9es, la provenance et la conservation \u00e0 long terme.","breadcrumb":{"@id":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/#breadcrumb"},"inLanguage":"fr-FR","potentialAction":[{"@type":"ReadAction","target":["https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/"]}]},{"@type":"BreadcrumbList","@id":"https:\/\/matforge.org\/fr\/managing-large-scale-scientific-datasets-storage-strategies-for-long-term-research\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https:\/\/matforge.org\/"},{"@type":"ListItem","position":2,"name":"G\u00e9rer des ensembles de donn\u00e9es scientifiques \u00e0 grande \u00e9chelle : strat\u00e9gies de stockage pour la recherche \u00e0 long terme"}]},{"@type":"WebSite","@id":"https:\/\/matforge.org\/#website","url":"https:\/\/matforge.org\/","name":"matforge.org","description":"","potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/matforge.org\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"fr-FR"},{"@type":"Person","@id":"https:\/\/matforge.org\/#\/schema\/person\/980162bb5de46742daece973661d93da","name":"Elena Markovska","image":{"@type":"ImageObject","inLanguage":"fr-FR","@id":"https:\/\/secure.gravatar.com\/avatar\/2de4e35b6581d7d8a839335156c6b5834cfaa0aef537a1c837e882dc57eea1e7?s=96&d=mm&r=g","url":"https:\/\/secure.gravatar.com\/avatar\/2de4e35b6581d7d8a839335156c6b5834cfaa0aef537a1c837e882dc57eea1e7?s=96&d=mm&r=g","contentUrl":"https:\/\/secure.gravatar.com\/avatar\/2de4e35b6581d7d8a839335156c6b5834cfaa0aef537a1c837e882dc57eea1e7?s=96&d=mm&r=g","caption":"Elena Markovska"},"sameAs":["http:\/\/matforge.org"],"url":"https:\/\/matforge.org\/author\/elena-markovska\/"}]}},"_links":{"self":[{"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/posts\/1247","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/comments?post=1247"}],"version-history":[{"count":1,"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/posts\/1247\/revisions"}],"predecessor-version":[{"id":1343,"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/posts\/1247\/revisions\/1343"}],"wp:attachment":[{"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/media?parent=1247"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/categories?post=1247"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/matforge.org\/wp-json\/wp\/v2\/tags?post=1247"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}