Storing is not archiving

← Back

Category: Solution

Tag:

Date: 13 juin 2019

Laurence Barney

Editorial Manager

When looking at this from the perspective of the human activity that the Archive bears witness to, what matters is the informational content — the evidence of that activity — which is the very purpose of preservation

The term « archiving » is very often misused in the field of information technology.

It is widely used to describe moving data storage to a dedicated space, for the purpose of optimizing commonly used storage space. The same confusion applies to the archiving of physical documents, which some reduce to simply delegating the storage of physical media to another department, by having it transported elsewhere.

When it comes to the digital archiving of documents, one recurring topic concerns the ability of storage media to preserve binary information for the desired length of time, even if that duration is virtually unlimited.

Even though this issue is central, preserving data is not archiving

The fastest, most reliable, most durable storage technologies will never be able to do more than preserve a sequence of zeros and ones that is meaningless to a human being.

To archive, then, is to be able to render the informational content whenever it needs to be used. This is where the concept of encoding, or representation format, comes in — it defines how the binary data is organized. It must enable a technical device to decode the binary stream and provide the user with an intelligible representation of the information it contains, most often on a computer screen.

This, then, is the subject of this series of articles: setting aside the issue of binary data storage, how can we ensure that the informational content encoded in today’s digital formats will still be usable in 10, 30, 500 years, or more?

This need calls for at least three essential actions

Identifying and characterizing the encoding format of digital content. This task can be assigned to the producer itself, if it has the technical tools and knowledge, or otherwise (which will most often be the case) to the department responsible for preservation.

Preserving information about the format along with the means of rendering the information from the digital content. The OAIS model incorporates this into its conceptual model as representation information.

Sustaining the technical means of rendering the informational content throughout the information’s lifecycle. Two main approaches are currently being explored: converting binary content encoded in a format that is becoming obsolete into a more recent or more sustainable format, suited for use by the widest possible audience for a longer or shorter period, or preserving the technical environment that allows the information to be rendered.

Xelians Group

The Xelians Group operates at the heart of the business challenges facing companies and public-sector organizations.

Learn more →

Choose the open-source reference

More than 100,000 users already trust us!

Stocker n’est pas archiver

← Retour

Catégorie : Solution

Étiquette :

Date : 13 juin 2019

Laurence Barney

Responsable de l’édition

Lorsque l’on se place du point de vue de l’activitĂ© humaine dont l’Archive est le tĂ©moin, l’important rĂ©side dans le contenu informationnel, la preuve de l’activitĂ©, qui est l’objet mĂȘme de la conservation

Le terme « archivage » est bien souvent dĂ©voyĂ© dans le domaine des technologies de l’information.

Il est largement employĂ© pour dĂ©signer un dĂ©placement du stockage des donnĂ©es vers un espace dĂ©diĂ©, Ă  des fins d’optimisation des espaces utilisĂ©s couramment. La mĂȘme confusion est faite avec l’archivage des documents physiques, qui pourrait ĂȘtre rĂ©duite Ă  dĂ©lĂ©guer la conservation des supports Ă  un autre service, par le biais d’un transport.

Lorsqu’on parle d’archivage numĂ©rique des documents, l’un des sujets rĂ©currents concerne la capacitĂ© des supports de stockage Ă  assurer la conservation de l’information binaire pour la durĂ©e souhaitĂ©e, fut-elle virtuellement illimitĂ©e.

MĂȘme si ce problĂšme est central, conserver les donnĂ©es n’est pas archiver

Les technologies de stockage les plus rapides, les plus fiables, les plus pĂ©rennes, ne seront jamais en mesure que de conserver une suite de zĂ©ros et de uns inintelligibles pour un ĂȘtre humain.

Pour archiver, il faut donc ĂȘtre en mesure de restituer le contenu informationnel lorsqu’il doit ĂȘtre utilisĂ©. C’est lĂ  qu’intervient la notion d’encodage ou de format de reprĂ©sentation, qui dĂ©finit la maniĂšre dont les donnĂ©es binaires sont organisĂ©es. Elle doit permettre Ă  un dispositif technique de dĂ©coder le flux binaire pour fournir Ă  l’utilisateur une reprĂ©sentation intelligible de l’information contenue, le plus souvent sur un moniteur d’ordinateur.

Voici donc l’objet de cette sĂ©rie de publications: Nonobstant le problĂšme du stockage des donnĂ©es binaires, comment s’assurer que le contenu informationnel encodĂ© dans les formats numĂ©riques d’aujourd’hui sera exploitable dans 10, 30, 500 ans ou plus ?

Ce besoin appelle au moins trois actions essentielles

L’identification et la caractĂ©risation du format d’encodage des contenus numĂ©riques. Cette tĂąche peut ĂȘtre dĂ©volue au producteur lui-mĂȘme s’il possĂšde les outils techniques et la connaissance, ou Ă  dĂ©faut (ce qui sera le cas le plus souvent) au service qui a la responsabilitĂ© de la conservation.

La conservation de l’information sur le format et des moyens de restituer l’information Ă  partir des contenus numĂ©riques. Le modĂšle OAIS intĂšgre ceci dans son modĂšle conceptuel en tant qu’information de reprĂ©sentation.

La pĂ©rennisation des moyens techniques de restitution du contenu informationnel tout au long du cycle de vie de l’information. Deux grands axes sont aujourd’hui explorĂ©s : convertir le contenu binaire encodĂ© dans un format qui devient obsolĂšte vers un format plus rĂ©cent ou plus pĂ©renne, propre Ă  ĂȘtre exploitĂ© par le plus grand nombre pour une pĂ©riode plus ou moins longue, ou bien conserver l’environnement technique qui permet de restituer l’information.

Groupe Xelians

Le groupe Xelians agit au cƓur des enjeux business des entreprises et des organisations publiques.

En savoir plus →

Adopter la référence open source

Plus de 100 000 utilisateurs nous font déjà confiance !

The Great Debate

← Back

Category:

Tag:

Date: 13 juin 2019

Laurence Barney

Editorial Manager

The Archiveco Group made nearly 200,000 responses — often handwritten — digitally readable in 12 days

Following a call for tenders, the Archiveco Group (alongside two other players) was selected to meet the Prime Minister’s request for the digitization of the grievance books (cahiers de dolĂ©ances) held as part of the Great National Debate (Grand DĂ©bat National).

The various technologies used to process handwritten and typewritten text made the difference, given the constraints set out by the Prime Minister’s office. Mastery of several complementary technologies allowed Archiveco to render the handwritten grievances — often written with uncertain spelling and syntax — as interpretable digital files.

Confidentiality was a key concern for this mission: a confidentiality clause, strengthened for the occasion, was signed by the entire team. More than 40 people worked six days a week to meet the demand and the constraints of the news cycle. The teams were spread across five secure regional sites of the Group in France: Paris (4), Lyon (19), Bordeaux (3), Avignon (5), and Saint-Quentin (10). A smaller team is still working on late submissions.

For more information about this project, we would be delighted to arrange an interview with Jean-Marc Delesalle, Chairman of Scan-Eco, the Digital BPO Division of the Archiveco Group.

About the Archiveco Group

A leading French player for more than 40 years.

The Archiveco Group is a trusted service provider recognized by more than 11,000 clients, businesses, and public administrations. Made up of Archiveco and Locarchives, trusted third-party archivists, Scan-Eco, a digitization and BPO provider, CD-DOC, a document management (EDM) integrator, and Maarch, a software publisher, the Archiveco Group offers a complete range of outsourcing services and software solutions.

It allows its clients to secure, organize, share, and gain productivity in the processing of their documents and archives, regardless of the format of the media, digital or physical. Consolidated key figures: €78M in revenue – 750 employees – more than 98% satisfied clients – 37 storage sites – 50 million pages digitized per year – 1 petabyte of storage capacity.

The Archiveco Group, a responsible and committed player, is invested every day in a quality-driven approach. Its various solutions and services are certified, approved and accredited (NF Service Z40-350, ISO 9001 and NF Z 42-013 standards, Health Data Hosting (HDS) certification, public archives accreditation for paper and electronic media).

Press contacts:

OXYGEN Agency
Emmanuelle PIONNIER / Tatiana GRAFFEUIL
Phone: 01 84 02 11 31
Email: emmanuelle.rp@oxygen-rp.com

Xelians Group

The Xelians Group operates at the heart of the business challenges facing companies and public-sector organizations.

Learn more →

Choose the open-source reference

More than 100,000 users already trust us!

Posted in Non classé

Le grand débat

← Retour

Catégorie : Actualité

Étiquette :

Date : 13 juin 2019

Laurence Barney

Responsable de l’édition

Le groupe Archiveco a rendu numériquement lisibles prÚs de 200 000 réponses, souvent manuscrites, en 12 jours

AprĂšs un appel d’offre, le groupe Archiveco (avec 2 autres acteurs), a Ă©tĂ© retenu pour rĂ©pondre au besoin du 1er Ministre pour la numĂ©risation des cahiers de dolĂ©ances en marge du Grand DĂ©bat National.

Les différentes technologies de traitement des écritures manuelles et dactylographiées ont fait la différence, en fonction des contraintes exprimées par le 1er Ministre. La maßtrise de plusieurs technologies complémentaires a permis à Archiveco de restituer, en fichiers numériques interprétables, les doléances manuscrites écrites souvent avec des orthographes et syntaxes hasardeuses.

La confidentialitĂ© Ă©tait un enjeu clĂ© pour cette mission, une clause a Ă©tĂ© signĂ©e par l’ensemble de l’équipe, renforcĂ©e pour l’occasion. Plus de 40 personnes se sont attelĂ©es 6 jours sur 7 pour rĂ©pondre Ă  la demande et aux contraintes de l’actualitĂ©. L’ensemble des Ă©quipes a Ă©tĂ© rĂ©parti sur 5 sites sĂ©curisĂ©s rĂ©gionaux du groupe en France : Paris (4), Lyon (19), Bordeaux (3), Avignon (5), St Quentin (10). Une Ă©quipe rĂ©duite est toujours en activitĂ© pour les retardataires.

Pour plus d’informations sur ce projet, nous serions ravis de vous organiser un entretien avec Jean-Marc Delesalle, PrĂ©sident de Scan-Eco, Division NumĂ©rique BPO du groupe Archiveco.

À propos du Groupe Archiveco

Acteur Français de référence depuis plus de 40 ans.

Le Groupe Archiveco est un prestataire de confiance reconnu par plus de 11000 clients, entreprises et administrations. ConstituĂ© de Archiveco et Locarchives, tiers archiveurs de confiance, Scan-Eco, prestataire de numĂ©risation et de BPO, CD-DOC, intĂ©grateur de GED, et Maarch Ă©diteur de logiciels, le Groupe Archiveco propose une gamme complĂšte de prestations de services d’externalisation et de solutions logicielles.

Il permet Ă  ses clients de sĂ©curiser, organiser, partager, gagner en productivitĂ© dans leur traitement des documents et des archives, quel que soit le format des supports, numĂ©riques et physiques. Les chiffres clĂ© consolidĂ©s : 78 M€ de CA – 750 salariĂ©s – plus de 98% de clients satisfaits – 37 sites de conservation – 50 millions de pages numĂ©risĂ©es par an – 1 Petaoctet de capacitĂ© de stockage.

Le Groupe Archiveco, acteur responsable et engagé, est investi au quotidien dans une démarche qualité. Ses différentes solutions et prestations sont certifiées, agréées, labellisées (NF Service Z40-350, ISO 9001 et NF Z 42-013, hébergeur de données de santé, archives publiques sur supports papier et électroniques).

Contacts presse :

Agence OXYGEN
Emmanuelle PIONNIER / Tatiana GRAFFEUIL
Téléphone : 01 84 02 11 31
Mail : emmanuelle.rp@oxygen-rp.com

Groupe Xelians

Le groupe Xelians agit au cƓur des enjeux business des entreprises et des organisations publiques.

En savoir plus →

Adopter la référence open source

Plus de 100 000 utilisateurs nous font déjà confiance !

Reference frameworks and identification methods

← Back

Category: Solution

Tag:

Date: 6 juin 2019

Laurence Barney

Editorial Manager

For an information system to render the information contained in a binary data stream, it must know the encoding format

There are two main categories of representation information:

Those based on information external to the content (metadata), and those that use internal signatures, recognizing the format from the structure of part of the content.

The file extension

The file name extension is an example of an external signature. Microsoft’s Windows operating system, for example, uses it to determine — via an internal registry — the software to use by default to display the content. Sometimes the system provides this information by default; otherwise, it is up to third-party software, when installed, to register itself as capable of opening certain file types.

It goes without saying that this mechanism has several major drawbacks:

First, it is impossible to determine the format without the file name information being available. This is incompatible with data exchange over protocols such as HTTP, for example, unless additional file headers are transmitted.

Next, this information is partial, since the file extension is not universal — it can potentially be used by several different pieces of software, or by several versions of the same format. The PDF format, for example, currently exists in 30 versions, some standardized and others not, all of which carry the same « pdf » extension.

Finally, this information can be altered by simply renaming the file. Replacing the « docx » extension of a Microsoft Word file with « zip » is enough to open it with compression software and see the files it contains. Replace the « pdf » extension of an Adobe document with « txt » and you prevent users from easily using it.

The file name extension should therefore be reserved for operating systems, which have a file system and maintain a registry of the applications usable by default to display them.

The MIME type

This is a two-part format identifier, originally used by the Multipurpose Internet Mail Extensions (MIME) standard to define the encoding of content or headers in non-ASCII emails.

This system was later extended to other protocols such as HTTP. IANA maintains a registry of media types and character encodings. Their list is publicly accessible on the Internet at the following address:

http://www.iana.org/assignments/media-types/media-types.xhtml

A MIME type is made up of at least two parts:

A type and a subtype, accompanied by one or more additional fields as needed. For example, subtypes of the « text » type have an optional « charset » field indicating the character encoding.

The MIME types are: audio, image, message (email), model (3D), multipart (email content), text, video, application, and vnd for vendor-specific types. The subtype specifies the format and depends on the type.

Below are a few examples of MIME types:

application/pdf
application/vnd.openxmlformats-officedocument.wordprocessingml.document
application/xml
application/zip
application/octet-stream
audio/mpeg
audio/flac
image/gif
image/jpeg
image/png
text/html
text/csv
text/plain
video/mpeg
video/mp4

The MIME type is determined by a software component shipped with the operating system, the software, or the runtime environment of a programming language. It uses the « magic numbers » of the content to link it to types and subtypes via a « magic database ». Format detection is thus achieved through an internal signature that provides the magic number — already a positive point, since it requires no external information.

On the other hand, the MIME type remains fairly imprecise, as it often cannot distinguish between format versions or multimedia encoding, for example. Moreover, the magic number database is not a controlled reference; it exists in many versions produced by various organizations or communities and is not officially registered with any authority.

The MIME type is suited to representing content in emails and web interfaces, not to archiving.

Format registries for archiving

Several digital format registry projects intended for the preservation of digital data have been initiated by public bodies from different countries. Some have been discontinued, while others remain active.

The Global Digital Format Registry (GDFR) was a project of the Harvard University Library that was discontinued in the late 2000s.

See: http://library.harvard.edu/preservation/digital-preservation_gdfr.html

The Library of Congress in the United States offers methods for content classification, characterization, and conversion planning, based on a reference registry that describes more than 400 formats in considerable detail.

See: http://www.nationalarchives.gov.uk/PRONOM

The National Archives of the United Kingdom has published the PRONOM registry since 2002, which remains to this day the only public and operational registry of its kind in the world, providing the community with tools (DROID) and methods to identify and qualify formats. Each format notably has a unique, universal identifier called a PUID, which makes resource management easier.

See: http://www.digitalpreservation.gov/formats

The Unified Digital Format Registry (UDFR) is a project developed by the University of California that attempts to unify the resources of the PRONOM and GDFR registries in a community-supported, open-source project.

See: http://www.udfr.org

Xelians Group

The Xelians Group operates at the heart of the business challenges facing companies and public-sector organizations.

Learn more →

Choose the open-source reference

More than 100,000 users already trust us!

RĂ©fĂ©rentiels et mĂ©thodes d’identification

← Retour

Catégorie : Solution

Étiquette :

Date : 6 juin 2019

Laurence Barney

Responsable de l’édition

Pour qu’un systĂšme d’information puisse restituer l’information Ă  partir d’un contenu de donnĂ©es binaire, il doit connaĂźtre le format d’encodage

Il existe deux grandes catĂ©gories d’information de reprĂ©sentation :

Celles qui se basent sur des informations externes au contenu (des mĂ©tadonnĂ©es) et celles qui utilisent des signatures internes en reconnaissant le format d’aprĂšs la structuration d’une partie du contenu.

L’extension de fichier

L’extension de nom de fichier est un exemple de signature externe. Le systĂšme Windows de Microsoft l’utilise par exemple afin de dĂ©terminer via Ă  un registre interne le logiciel Ă  utiliser par dĂ©faut pour en reprĂ©senter le contenu. Parfois le systĂšme apporte cette information par dĂ©faut, sinon charge au logiciel tiers lors de son installation de s’inscrire au registre comme capable d’ouvrir les fichiers tels ou tels types.

Il va sans dire que cette mécanique présente plusieurs inconvénients majeurs :

Tout d’abord il est impossible de dĂ©terminer le format sans que l’information de nom de fichier soit disponible. C’est incompatible avec des Ă©changes de donnĂ©es au travers de protocoles tels que http par exemple, sans transmettre des en-tĂȘtes de fichiers complĂ©mentaires.

Ensuite cette information est partielle, car l’extension de fichier n’est pas universelle, elle potentiellement peut ĂȘtre utilisĂ©e par plusieurs logiciels ou versions d’un mĂȘme format. Le format PDF par exemple, existe Ă  ce jour dans 30 versions, dont certaines sont normalisĂ©es et d’autres non, et qui seront tous porteurs d’une extension « pdf ».

Enfin, l’information peut ĂȘtre modifiĂ©e par simple renommage du fichier. Il suffit de remplacer l’extension « docx » d’un format Microsoft Word par « zip » pour pouvoir l’ouvrir avec un logiciel de compression et en voir les fichiers contenus. Remplacez l’extension « pdf » d’un document Adobe par « txt » et vous empĂȘchez les utilisateurs de l’exploiter facilement.

L’extension de nom de fichier est donc Ă  rĂ©server aux systĂšmes d’exploitation, qui possĂšdent un systĂšme de fichiers et qui tiennent un registre des applications utilisables par dĂ©faut pour leur reprĂ©sentation.

Le type MIME

Il s’agit de l’identification du format d’un contenu en deux parties utilisĂ© Ă  l’origine par le standard Multipurpose Internet Mail Extensions (MIME) ou Extensions multifonctions du courrier Internet pour dĂ©finir l’encodage du contenu ou des en-tĂȘtes des courriers Ă©lectroniques non ASCII.

Ce systĂšme a Ă©tĂ© Ă©tendu par la suite Ă  d’autres protocoles comme HTTP. L’IANA maintient un registre des media types et des codages de caractĂšres. Leur liste est accessible publiquement sur Internet Ă  l’adresse : 

http://www.iana.org/assignments/media-types/media-types.xhtml

Un type MIME est composĂ© d’au moins deux parties :

Un type et un sous-type accompagnĂ©s d’un ou plusieurs autres champs au besoin. Par exemple, les sous-types du type « text » ont un champ optionnel « charset » indiquant le codage des caractĂšres.

Les types MIME sont : audio, image, message (courriel), model (3D), multipart (contenu de courriel), text, video, application et vnd pour les types spécifiques à des éditeurs. Le sous-type précise le format, et dépend du type.

Ci-dessous quelques exemples de types MIME :

application/pdf
application/vnd.openxmlformats-officedocument.wordprocessingml.document
application/xml
application/zip
application/octet-stream
audio/mpeg
audio/flac
image/gif
image/jpeg
image/png
text/html
text/csv
text/plain
video/mpeg
video/mp4

Le type MIME est dĂ©terminĂ© par un composant logiciel livrĂ© avec le systĂšme d’exploitation, le logiciel ou l’environnement d’exĂ©cution d’un langage de programmation. Il utilise les nombres magiques (« magic numbers ») des contenus pour les lier Ă  des types et sous-types au travers d’une base de donnĂ©es (« magic database »). La dĂ©tection du format est ainsi rĂ©alisĂ©e grĂące Ă  une signature interne qui fournit le nombre magique, ce qui est dĂ©jĂ  un point positif car elle ne nĂ©cessite aucune information externe.

Par contre, le type MIME reste assez imprĂ©cis car il ne permet souvent pas de diffĂ©rencier les versions des formats ni l’encodage multimĂ©dia par exemple. De plus la base de donnĂ©es des nombres magiques ne constitue pas un rĂ©fĂ©rentiel contrĂŽlĂ©; Elle existe dans de nombreuses versions produites par des organisations ou communautĂ©s diverses et n’est officiellement enregistrĂ©e auprĂšs d’aucune autoritĂ©.

Le type MIME est adaptĂ© Ă  la reprĂ©sentation du contenu dans les messages Ă©lectroniques et les interfaces web, pas Ă  l’archivage.

Les registres de formats pour l’archivage

Il existe plusieurs projets de registre des formats numĂ©riques destinĂ©s Ă  la conservation des donnĂ©es numĂ©riques, initiĂ©s par des organismes publics de diffĂ©rentes nationalitĂ©s. Certains ont Ă©tĂ© abandonnĂ©s et d’autres sont toujours actifs.

Le Global Digital Format Registry (GDFR ou Registre Global des Formats NumĂ©riques) était un projet de la BibliothĂšque de l’UniversitĂ© de Harvard qui a Ă©tĂ© abandonnĂ© Ă  la fin des annĂ©es 2000.

cf. http://library.harvard.edu/preservation/digital-preservation_gdfr.html

La BibliothÚque du CongrÚs aux Etats-Unis propose des méthodes de classification des contenus, de caractérisation et de planification des conversions basées sur un référentiel décrivant assez précisément plus de 400 formats.

cf. http://www.nationalarchives.gov.uk/PRONOM

Les Archives Nationales du Royaume-Uni publient depuis 2002 le rĂ©fĂ©rentiel PRONOM, qui reste Ă  ce jour le seul registre public et opĂ©rationnel dans le monde, en mettant Ă  disposition de la communautĂ© des outils (DROID) et mĂ©thodes pour assurer l’identification et la qualification des formats. Chaque format possĂšde notamment un identifiant unique universel, appelĂ© puid, qui facilite la gestion des ressources.

cf. http://www.digitalpreservation.gov/formats

Le Unified Digital Format Registry (UDFR) est un projet dĂ©veloppĂ© par l’UniversitĂ© de Californie, qui tente d’unifier les ressources des registres PRONOM et GDFR dans un projet open-source supportĂ© par la communautĂ©.

cf. http://www.udfr.org

Groupe Xelians

Le groupe Xelians agit au cƓur des enjeux business des entreprises et des organisations publiques.

En savoir plus →

Adopter la référence open source

Plus de 100 000 utilisateurs nous font déjà confiance !