Storing is not archiving

← Back

Category: Solution

Tag:

Date: 13 juin 2019

Laurence Barney

Editorial Manager

When looking at this from the perspective of the human activity that the Archive bears witness to, what matters is the informational content — the evidence of that activity — which is the very purpose of preservation

The term « archiving » is very often misused in the field of information technology.

It is widely used to describe moving data storage to a dedicated space, for the purpose of optimizing commonly used storage space. The same confusion applies to the archiving of physical documents, which some reduce to simply delegating the storage of physical media to another department, by having it transported elsewhere.

When it comes to the digital archiving of documents, one recurring topic concerns the ability of storage media to preserve binary information for the desired length of time, even if that duration is virtually unlimited.

Even though this issue is central, preserving data is not archiving

The fastest, most reliable, most durable storage technologies will never be able to do more than preserve a sequence of zeros and ones that is meaningless to a human being.

To archive, then, is to be able to render the informational content whenever it needs to be used. This is where the concept of encoding, or representation format, comes in — it defines how the binary data is organized. It must enable a technical device to decode the binary stream and provide the user with an intelligible representation of the information it contains, most often on a computer screen.

This, then, is the subject of this series of articles: setting aside the issue of binary data storage, how can we ensure that the informational content encoded in today’s digital formats will still be usable in 10, 30, 500 years, or more?

This need calls for at least three essential actions

Identifying and characterizing the encoding format of digital content. This task can be assigned to the producer itself, if it has the technical tools and knowledge, or otherwise (which will most often be the case) to the department responsible for preservation.

Preserving information about the format along with the means of rendering the information from the digital content. The OAIS model incorporates this into its conceptual model as representation information.

Sustaining the technical means of rendering the informational content throughout the information’s lifecycle. Two main approaches are currently being explored: converting binary content encoded in a format that is becoming obsolete into a more recent or more sustainable format, suited for use by the widest possible audience for a longer or shorter period, or preserving the technical environment that allows the information to be rendered.

Xelians Group

The Xelians Group operates at the heart of the business challenges facing companies and public-sector organizations.

Learn more →

Choose the open-source reference

More than 100,000 users already trust us!

Stocker n’est pas archiver

← Retour

Catégorie : Solution

Étiquette :

Date : 13 juin 2019

Laurence Barney

Responsable de l’édition

Lorsque l’on se place du point de vue de l’activité humaine dont l’Archive est le témoin, l’important réside dans le contenu informationnel, la preuve de l’activité, qui est l’objet même de la conservation

Le terme « archivage » est bien souvent dévoyé dans le domaine des technologies de l’information.

Il est largement employé pour désigner un déplacement du stockage des données vers un espace dédié, à des fins d’optimisation des espaces utilisés couramment. La même confusion est faite avec l’archivage des documents physiques, qui pourrait être réduite à déléguer la conservation des supports à un autre service, par le biais d’un transport.

Lorsqu’on parle d’archivage numérique des documents, l’un des sujets récurrents concerne la capacité des supports de stockage à assurer la conservation de l’information binaire pour la durée souhaitée, fut-elle virtuellement illimitée.

Même si ce problème est central, conserver les données n’est pas archiver

Les technologies de stockage les plus rapides, les plus fiables, les plus pérennes, ne seront jamais en mesure que de conserver une suite de zéros et de uns inintelligibles pour un être humain.

Pour archiver, il faut donc être en mesure de restituer le contenu informationnel lorsqu’il doit être utilisé. C’est là qu’intervient la notion d’encodage ou de format de représentation, qui définit la manière dont les données binaires sont organisées. Elle doit permettre à un dispositif technique de décoder le flux binaire pour fournir à l’utilisateur une représentation intelligible de l’information contenue, le plus souvent sur un moniteur d’ordinateur.

Voici donc l’objet de cette série de publications: Nonobstant le problème du stockage des données binaires, comment s’assurer que le contenu informationnel encodé dans les formats numériques d’aujourd’hui sera exploitable dans 10, 30, 500 ans ou plus ?

Ce besoin appelle au moins trois actions essentielles

L’identification et la caractérisation du format d’encodage des contenus numériques. Cette tâche peut être dévolue au producteur lui-même s’il possède les outils techniques et la connaissance, ou à défaut (ce qui sera le cas le plus souvent) au service qui a la responsabilité de la conservation.

La conservation de l’information sur le format et des moyens de restituer l’information à partir des contenus numériques. Le modèle OAIS intègre ceci dans son modèle conceptuel en tant qu’information de représentation.

La pérennisation des moyens techniques de restitution du contenu informationnel tout au long du cycle de vie de l’information. Deux grands axes sont aujourd’hui explorés : convertir le contenu binaire encodé dans un format qui devient obsolète vers un format plus récent ou plus pérenne, propre à être exploité par le plus grand nombre pour une période plus ou moins longue, ou bien conserver l’environnement technique qui permet de restituer l’information.

Groupe Xelians

Le groupe Xelians agit au cœur des enjeux business des entreprises et des organisations publiques.

En savoir plus →

Adopter la référence open source

Plus de 100 000 utilisateurs nous font déjà confiance !

The Great Debate

← Back

Category:

Tag:

Date: 13 juin 2019

Laurence Barney

Editorial Manager

The Archiveco Group made nearly 200,000 responses — often handwritten — digitally readable in 12 days

Following a call for tenders, the Archiveco Group (alongside two other players) was selected to meet the Prime Minister’s request for the digitization of the grievance books (cahiers de doléances) held as part of the Great National Debate (Grand Débat National).

The various technologies used to process handwritten and typewritten text made the difference, given the constraints set out by the Prime Minister’s office. Mastery of several complementary technologies allowed Archiveco to render the handwritten grievances — often written with uncertain spelling and syntax — as interpretable digital files.

Confidentiality was a key concern for this mission: a confidentiality clause, strengthened for the occasion, was signed by the entire team. More than 40 people worked six days a week to meet the demand and the constraints of the news cycle. The teams were spread across five secure regional sites of the Group in France: Paris (4), Lyon (19), Bordeaux (3), Avignon (5), and Saint-Quentin (10). A smaller team is still working on late submissions.

For more information about this project, we would be delighted to arrange an interview with Jean-Marc Delesalle, Chairman of Scan-Eco, the Digital BPO Division of the Archiveco Group.

About the Archiveco Group

A leading French player for more than 40 years.

The Archiveco Group is a trusted service provider recognized by more than 11,000 clients, businesses, and public administrations. Made up of Archiveco and Locarchives, trusted third-party archivists, Scan-Eco, a digitization and BPO provider, CD-DOC, a document management (EDM) integrator, and Maarch, a software publisher, the Archiveco Group offers a complete range of outsourcing services and software solutions.

It allows its clients to secure, organize, share, and gain productivity in the processing of their documents and archives, regardless of the format of the media, digital or physical. Consolidated key figures: €78M in revenue – 750 employees – more than 98% satisfied clients – 37 storage sites – 50 million pages digitized per year – 1 petabyte of storage capacity.

The Archiveco Group, a responsible and committed player, is invested every day in a quality-driven approach. Its various solutions and services are certified, approved and accredited (NF Service Z40-350, ISO 9001 and NF Z 42-013 standards, Health Data Hosting (HDS) certification, public archives accreditation for paper and electronic media).

Press contacts:

OXYGEN Agency
Emmanuelle PIONNIER / Tatiana GRAFFEUIL
Phone: 01 84 02 11 31
Email: emmanuelle.rp@oxygen-rp.com

Xelians Group

The Xelians Group operates at the heart of the business challenges facing companies and public-sector organizations.

Learn more →

Choose the open-source reference

More than 100,000 users already trust us!

Posted in Non classé

Le grand débat

← Retour

Catégorie : Actualité

Étiquette :

Date : 13 juin 2019

Laurence Barney

Responsable de l’édition

Le groupe Archiveco a rendu numériquement lisibles près de 200 000 réponses, souvent manuscrites, en 12 jours

Après un appel d’offre, le groupe Archiveco (avec 2 autres acteurs), a été retenu pour répondre au besoin du 1er Ministre pour la numérisation des cahiers de doléances en marge du Grand Débat National.

Les différentes technologies de traitement des écritures manuelles et dactylographiées ont fait la différence, en fonction des contraintes exprimées par le 1er Ministre. La maîtrise de plusieurs technologies complémentaires a permis à Archiveco de restituer, en fichiers numériques interprétables, les doléances manuscrites écrites souvent avec des orthographes et syntaxes hasardeuses.

La confidentialité était un enjeu clé pour cette mission, une clause a été signée par l’ensemble de l’équipe, renforcée pour l’occasion. Plus de 40 personnes se sont attelées 6 jours sur 7 pour répondre à la demande et aux contraintes de l’actualité. L’ensemble des équipes a été réparti sur 5 sites sécurisés régionaux du groupe en France : Paris (4), Lyon (19), Bordeaux (3), Avignon (5), St Quentin (10). Une équipe réduite est toujours en activité pour les retardataires.

Pour plus d’informations sur ce projet, nous serions ravis de vous organiser un entretien avec Jean-Marc Delesalle, Président de Scan-Eco, Division Numérique BPO du groupe Archiveco.

À propos du Groupe Archiveco

Acteur Français de référence depuis plus de 40 ans.

Le Groupe Archiveco est un prestataire de confiance reconnu par plus de 11000 clients, entreprises et administrations. Constitué de Archiveco et Locarchives, tiers archiveurs de confiance, Scan-Eco, prestataire de numérisation et de BPO, CD-DOC, intégrateur de GED, et Maarch éditeur de logiciels, le Groupe Archiveco propose une gamme complète de prestations de services d’externalisation et de solutions logicielles.

Il permet à ses clients de sécuriser, organiser, partager, gagner en productivité dans leur traitement des documents et des archives, quel que soit le format des supports, numériques et physiques. Les chiffres clé consolidés : 78 M€ de CA – 750 salariés – plus de 98% de clients satisfaits – 37 sites de conservation – 50 millions de pages numérisées par an – 1 Petaoctet de capacité de stockage.

Le Groupe Archiveco, acteur responsable et engagé, est investi au quotidien dans une démarche qualité. Ses différentes solutions et prestations sont certifiées, agréées, labellisées (NF Service Z40-350, ISO 9001 et NF Z 42-013, hébergeur de données de santé, archives publiques sur supports papier et électroniques).

Contacts presse :

Agence OXYGEN
Emmanuelle PIONNIER / Tatiana GRAFFEUIL
Téléphone : 01 84 02 11 31
Mail : emmanuelle.rp@oxygen-rp.com

Groupe Xelians

Le groupe Xelians agit au cœur des enjeux business des entreprises et des organisations publiques.

En savoir plus →

Adopter la référence open source

Plus de 100 000 utilisateurs nous font déjà confiance !

Reference frameworks and identification methods

← Back

Category: Solution

Tag:

Date: 6 juin 2019

Laurence Barney

Editorial Manager

For an information system to render the information contained in a binary data stream, it must know the encoding format

There are two main categories of representation information:

Those based on information external to the content (metadata), and those that use internal signatures, recognizing the format from the structure of part of the content.

The file extension

The file name extension is an example of an external signature. Microsoft’s Windows operating system, for example, uses it to determine — via an internal registry — the software to use by default to display the content. Sometimes the system provides this information by default; otherwise, it is up to third-party software, when installed, to register itself as capable of opening certain file types.

It goes without saying that this mechanism has several major drawbacks:

First, it is impossible to determine the format without the file name information being available. This is incompatible with data exchange over protocols such as HTTP, for example, unless additional file headers are transmitted.

Next, this information is partial, since the file extension is not universal — it can potentially be used by several different pieces of software, or by several versions of the same format. The PDF format, for example, currently exists in 30 versions, some standardized and others not, all of which carry the same « pdf » extension.

Finally, this information can be altered by simply renaming the file. Replacing the « docx » extension of a Microsoft Word file with « zip » is enough to open it with compression software and see the files it contains. Replace the « pdf » extension of an Adobe document with « txt » and you prevent users from easily using it.

The file name extension should therefore be reserved for operating systems, which have a file system and maintain a registry of the applications usable by default to display them.

The MIME type

This is a two-part format identifier, originally used by the Multipurpose Internet Mail Extensions (MIME) standard to define the encoding of content or headers in non-ASCII emails.

This system was later extended to other protocols such as HTTP. IANA maintains a registry of media types and character encodings. Their list is publicly accessible on the Internet at the following address:

http://www.iana.org/assignments/media-types/media-types.xhtml

A MIME type is made up of at least two parts:

A type and a subtype, accompanied by one or more additional fields as needed. For example, subtypes of the « text » type have an optional « charset » field indicating the character encoding.

The MIME types are: audio, image, message (email), model (3D), multipart (email content), text, video, application, and vnd for vendor-specific types. The subtype specifies the format and depends on the type.

Below are a few examples of MIME types:

application/pdf
application/vnd.openxmlformats-officedocument.wordprocessingml.document
application/xml
application/zip
application/octet-stream
audio/mpeg
audio/flac
image/gif
image/jpeg
image/png
text/html
text/csv
text/plain
video/mpeg
video/mp4

The MIME type is determined by a software component shipped with the operating system, the software, or the runtime environment of a programming language. It uses the « magic numbers » of the content to link it to types and subtypes via a « magic database ». Format detection is thus achieved through an internal signature that provides the magic number — already a positive point, since it requires no external information.

On the other hand, the MIME type remains fairly imprecise, as it often cannot distinguish between format versions or multimedia encoding, for example. Moreover, the magic number database is not a controlled reference; it exists in many versions produced by various organizations or communities and is not officially registered with any authority.

The MIME type is suited to representing content in emails and web interfaces, not to archiving.

Format registries for archiving

Several digital format registry projects intended for the preservation of digital data have been initiated by public bodies from different countries. Some have been discontinued, while others remain active.

The Global Digital Format Registry (GDFR) was a project of the Harvard University Library that was discontinued in the late 2000s.

See: http://library.harvard.edu/preservation/digital-preservation_gdfr.html

The Library of Congress in the United States offers methods for content classification, characterization, and conversion planning, based on a reference registry that describes more than 400 formats in considerable detail.

See: http://www.nationalarchives.gov.uk/PRONOM

The National Archives of the United Kingdom has published the PRONOM registry since 2002, which remains to this day the only public and operational registry of its kind in the world, providing the community with tools (DROID) and methods to identify and qualify formats. Each format notably has a unique, universal identifier called a PUID, which makes resource management easier.

See: http://www.digitalpreservation.gov/formats

The Unified Digital Format Registry (UDFR) is a project developed by the University of California that attempts to unify the resources of the PRONOM and GDFR registries in a community-supported, open-source project.

See: http://www.udfr.org

Xelians Group

The Xelians Group operates at the heart of the business challenges facing companies and public-sector organizations.

Learn more →

Choose the open-source reference

More than 100,000 users already trust us!

Référentiels et méthodes d’identification

← Retour

Catégorie : Solution

Étiquette :

Date : 6 juin 2019

Laurence Barney

Responsable de l’édition

Pour qu’un système d’information puisse restituer l’information à partir d’un contenu de données binaire, il doit connaître le format d’encodage

Il existe deux grandes catégories d’information de représentation :

Celles qui se basent sur des informations externes au contenu (des métadonnées) et celles qui utilisent des signatures internes en reconnaissant le format d’après la structuration d’une partie du contenu.

L’extension de fichier

L’extension de nom de fichier est un exemple de signature externe. Le système Windows de Microsoft l’utilise par exemple afin de déterminer via à un registre interne le logiciel à utiliser par défaut pour en représenter le contenu. Parfois le système apporte cette information par défaut, sinon charge au logiciel tiers lors de son installation de s’inscrire au registre comme capable d’ouvrir les fichiers tels ou tels types.

Il va sans dire que cette mécanique présente plusieurs inconvénients majeurs :

Tout d’abord il est impossible de déterminer le format sans que l’information de nom de fichier soit disponible. C’est incompatible avec des échanges de données au travers de protocoles tels que http par exemple, sans transmettre des en-têtes de fichiers complémentaires.

Ensuite cette information est partielle, car l’extension de fichier n’est pas universelle, elle potentiellement peut être utilisée par plusieurs logiciels ou versions d’un même format. Le format PDF par exemple, existe à ce jour dans 30 versions, dont certaines sont normalisées et d’autres non, et qui seront tous porteurs d’une extension « pdf ».

Enfin, l’information peut être modifiée par simple renommage du fichier. Il suffit de remplacer l’extension « docx » d’un format Microsoft Word par « zip » pour pouvoir l’ouvrir avec un logiciel de compression et en voir les fichiers contenus. Remplacez l’extension « pdf » d’un document Adobe par « txt » et vous empêchez les utilisateurs de l’exploiter facilement.

L’extension de nom de fichier est donc à réserver aux systèmes d’exploitation, qui possèdent un système de fichiers et qui tiennent un registre des applications utilisables par défaut pour leur représentation.

Le type MIME

Il s’agit de l’identification du format d’un contenu en deux parties utilisé à l’origine par le standard Multipurpose Internet Mail Extensions (MIME) ou Extensions multifonctions du courrier Internet pour définir l’encodage du contenu ou des en-têtes des courriers électroniques non ASCII.

Ce système a été étendu par la suite à d’autres protocoles comme HTTP. L’IANA maintient un registre des media types et des codages de caractères. Leur liste est accessible publiquement sur Internet à l’adresse : 

http://www.iana.org/assignments/media-types/media-types.xhtml

Un type MIME est composé d’au moins deux parties :

Un type et un sous-type accompagnés d’un ou plusieurs autres champs au besoin. Par exemple, les sous-types du type « text » ont un champ optionnel « charset » indiquant le codage des caractères.

Les types MIME sont : audio, image, message (courriel), model (3D), multipart (contenu de courriel), text, video, application et vnd pour les types spécifiques à des éditeurs. Le sous-type précise le format, et dépend du type.

Ci-dessous quelques exemples de types MIME :

application/pdf
application/vnd.openxmlformats-officedocument.wordprocessingml.document
application/xml
application/zip
application/octet-stream
audio/mpeg
audio/flac
image/gif
image/jpeg
image/png
text/html
text/csv
text/plain
video/mpeg
video/mp4

Le type MIME est déterminé par un composant logiciel livré avec le système d’exploitation, le logiciel ou l’environnement d’exécution d’un langage de programmation. Il utilise les nombres magiques (« magic numbers ») des contenus pour les lier à des types et sous-types au travers d’une base de données (« magic database »). La détection du format est ainsi réalisée grâce à une signature interne qui fournit le nombre magique, ce qui est déjà un point positif car elle ne nécessite aucune information externe.

Par contre, le type MIME reste assez imprécis car il ne permet souvent pas de différencier les versions des formats ni l’encodage multimédia par exemple. De plus la base de données des nombres magiques ne constitue pas un référentiel contrôlé; Elle existe dans de nombreuses versions produites par des organisations ou communautés diverses et n’est officiellement enregistrée auprès d’aucune autorité.

Le type MIME est adapté à la représentation du contenu dans les messages électroniques et les interfaces web, pas à l’archivage.

Les registres de formats pour l’archivage

Il existe plusieurs projets de registre des formats numériques destinés à la conservation des données numériques, initiés par des organismes publics de différentes nationalités. Certains ont été abandonnés et d’autres sont toujours actifs.

Le Global Digital Format Registry (GDFR ou Registre Global des Formats Numériques) était un projet de la Bibliothèque de l’Université de Harvard qui a été abandonné à la fin des années 2000.

cf. http://library.harvard.edu/preservation/digital-preservation_gdfr.html

La Bibliothèque du Congrès aux Etats-Unis propose des méthodes de classification des contenus, de caractérisation et de planification des conversions basées sur un référentiel décrivant assez précisément plus de 400 formats.

cf. http://www.nationalarchives.gov.uk/PRONOM

Les Archives Nationales du Royaume-Uni publient depuis 2002 le référentiel PRONOM, qui reste à ce jour le seul registre public et opérationnel dans le monde, en mettant à disposition de la communauté des outils (DROID) et méthodes pour assurer l’identification et la qualification des formats. Chaque format possède notamment un identifiant unique universel, appelé puid, qui facilite la gestion des ressources.

cf. http://www.digitalpreservation.gov/formats

Le Unified Digital Format Registry (UDFR) est un projet développé par l’Université de Californie, qui tente d’unifier les ressources des registres PRONOM et GDFR dans un projet open-source supporté par la communauté.

cf. http://www.udfr.org

Groupe Xelians

Le groupe Xelians agit au cœur des enjeux business des entreprises et des organisations publiques.

En savoir plus →

Adopter la référence open source

Plus de 100 000 utilisateurs nous font déjà confiance !