Computergestützte Kollationierung und ihre Integration in den editorischen Arbeitsfluss. Berlin: Berlin-Brandenburgische Akademie der Wissenschaften, 26.05.2006-27.05.2006.
Reviewed by Jan Lautenbach
Published on H-Soz-u-Kult (June, 2006)
Computergestützte Kollationierung und ihre Integration in den editorischen Arbeitsfluss
Die von der Berlin-Brandenburgischen Akademie der Wissenschaften (BBAW) veranstaltete Tagung "Computergestützte Kollationierung und ihre Integration in den editorischen Arbeitsfluss" (26./27. Mai 2006) hatte Workshop-Charakter: orientiert am zentralen Editionsvorgang 'Kollation' (der Vergleich von als variant angenommenen Texten) haben Wissenschaftler aus verschiedenen Bereichen ihre Arbeit vorgestellt. Aspekte der technischen Standardisierung und Problemlösung wurden präsentiert und mögliche Schnittpunkte der sehr unterschiedlichen aber substanziell ähnlich gelagerten Vorhaben diskutiert.
Zunächst sprach Christoph Markschies (Humboldt-Universität Berlin und BBAW) in seiner Begrüßung über die Bedeutung der durch digitale Techniken unterstützten Edition und öffnete den Blick auf perspektivisch notwendige Entwicklungen in diesem Bereich.
Vorträge
Michael Stolz und Friedrich-Michael Dimpel (Georg-August-Universität Göttingen) haben ihre Arbeit im Referat "Computergestütztes Kollationieren: Tustep – Collate – Anastasia. Ein Werkstattbericht aus dem Parzival-Projekt" vorgestellt. Die historische Darbietung des Parzival stellt in seinem Variantenreichtum eine editorische Herausforderung dar, für die eine Aufbereitung mit bzw. für das digitale Medium besonders geeignet scheint. Ausgehend von einer 4-Frame- bzw. 6-Frame-Synopse (http://www.parzival.unibas.ch/probed.html) wurde eine tabellarische Version vorgestellt. Vor der Darstellung hat sie ihre Besonderheit in der technischen Realisierung: im Editionsvorgang liefert Collate Daten im XML-Format. Diese werden mit Anastasia weiterverarbeitet und unter einer Apache-Server-Umgebung zur Verfügung gestellt. Im Unterschied zur Frame-Version, die auf einer statischen HTML-Konstruktion aufsetzt, wird zwischen Datenvorhalt (XML), Transformations- und Auszeichnungsebene getrennt. Die Abbildung ist dynamisch. Die Kombination von Collate und Anastasia scheint effektiv, jedoch sei der Aufwand trotz eines hohen Anteils an Automatisierung hinsichtlich Einarbeitung und Anpassung hoch.
Die Ausführungen "Automatische Kollation und ihre Grenzen" von Martin J. Schubert (Humboldt-Universität Berlin und BBAW) zielten auf den Umfang, in dem sich Kollationsphasen (Abweichungen Auffinden, Verzeichnen, Deuten, Auswerten) automatisieren lassen. Das Ausmaß manueller Tätigkeiten sei davon abhängig, wie viel "Mühe" im Einzelfall investiert und nachfolgend in konkreten Ergebnissen präsentiert werden könne. Ein Editor müsse auch die zügige Realisierung der Edition im Blick behalten. Zwar beschleunige die digitale Technik per se den Editionsprozess, jedoch könne sich der Arbeitsaufwand mit zunehmender Erfassungstiefe schnell potenzieren. Bei mehrfach überlieferten Texten zeige sich dies schon in der Phase der Transkription, der grafienahen Übertragung der Vorlagen. Das Spektrum reiche soweit, dass auf der einen Seite ohne Rücksicht auf den Inhalt jede Vorlage vollständig transkribiert werde. Der Grad der Interpretation wird dementsprechend niedrig gehalten. Andererseits könne es jedoch effektiver sein, Übertragung, Vergleich und Bewertung gleichzeitig (manuell) auszuführen. Hier können sich vorab stemmatologische Beziehungen offenbaren, die die vollständige oder teilweise Transkription einer Vorlage unnötig erscheinen lassen, weil sie mit einer anderen hinreichend parallel läuft. Auf diese Weise greift die Interpretation in die Erfassung ein. Wenn auch die Edition im gedruckten Ergebnis dadurch keinen Qualitätsverlust erleidet, so sind die Ausgangsdaten doch in ihrer Gesamtheit weniger konsistent.
Der folgende Vortrag "Offene Standards für kritische Editionen: Möglichkeiten und Grenzen von TEI-P5 für Kollationierung und Variantenerfassung" von Daniel Deckers (Universität Hamburg) führte diesen Ansatz unmittelbar thematisch fort. Vorgestellt wurden Grundzüge der Release 5 des XML-Dokumentenformats TEI (Text Encoding Initiative). Dieses ist zwar nicht offiziell verabschiedet, die Guidelines liegen hingegen vor. Es kann davon ausgegangen werden, dass sich neuere Vorhaben daran orientieren. Grundsätzlich haben die Lösungsvorschläge von TEI das Ziel, auf die Bedürfnisse der Textedition unmittelbar zu reagieren.
Daher verdichtete sich die Diskussion zunehmend auf generelle Grenzen des Normierbaren. Nur Texte, die einem gemeinsamen Muster folgen, können sinnvoll verglichen werden. Dafür bietet TEI die notwendigen Voraussetzungen. Allerdings führt schon die Erarbeitung einheitlicher Transkriptionsrichtlinien (Codierung von Sonder-/Zeichen, Normierung syntaktischer Einheiten etc.) zu Problemen. Angesichts des Kontrastbereichs, in dem Texte allgemein ediert werden, ließen sich Standards nur auf einer sehr flachen Ebene realisieren. Je genauer ein Dokument beschrieben wird, desto größer wird die strukturelle Abweichung gegen ein anderes.
Im Anschluss öffnete Dieter Harlfinger (Universität Hamburg) den Blick auf die "Vergegenwärtigung traditioneller Kollationsmethoden". Er trug in diesem Zusammenhang einen historischen Abriss vor und beschrieb die (manuellen) Kollationstechniken verschiedener Editoren. Martin Wallraff (Universität Basel) sprach die "Emanzipation des Textes vom Buch" und eine medienhistorischen Perspektive an, indem er sich den Möglichkeiten der computergestützten Edition "buchgebundener" Texte der Spätantike zuwandte.
Die beiden folgenden Beiträge waren Statements zu solchen Editionsphänomenen, die eine extreme Herausforderung an die digitale Technik darstellen: Stephan Seidlmayer und Doris Topmann (BBAW) präsentierten Beispiele aus der Praxis der "Kollationierung hieroglyphischer Texte"; ein scheinbar "unendlicher Zeichenvorrat" mache es notwendig, direkt die Kodierungen der syntaktischen Einheiten zu kollationieren. Kurt-Victor Selge (BBAW) zeigte an Illustrationen aus Joachim von Fiores "Zehnsaitigem Psalter", dass die immediate Verknüpfung von Text- mit Bildkomponenten besondere technische Anforderungen an die Edition darstellen. Auch vor dem Hintergrund dieser Vorträge bzw. Statements wurden die Perspektiven technischer Normen immer wieder abgewogen. Deren Limits wurden anhand der genannten Fälle deutlich.
Wie prinzipiell die Verständigung auf Standards ist, zeigt ein Projekt wie TextGrid, das von Fotis Jannidis (TU Darmstadt) präsentiert wurde. Mit Grid werden "Generische Plattformen" bezeichnet, in denen der tatsächliche Prozessbedarf auf die in einem Netz eingegliederten Rechner auslastungsabhängig verteilt wird. Vor allem in Bereichen mit hohem Prozessaufwand, beispielsweise Meteorologie und Physik, kommen solche Systeme zum Einsatz. TextGrid ist ein im Rahmen der Initiative D-Grid vom Bundesministerium für Bildung und Forschung gefördertes Vorhaben, das auf die Zunahme der Datenmengen und deren Vernetzung innerhalb der Geisteswissenschaften reagiert. Es ist als zentrale Editionsplattform geplant, mit der editorische Arbeitsabläufe ausgehend von einem Modul für das Textprozessing durchgeführt werden können. Indem sich u.a. an offenen Standards, (Betriebs-)Systemunabhängigkeit, niedriger Einstiegsstufe, Modularität und Nutzung neuerer Methoden bzw. Sprachen (backtracking, little language, FN-Query, unification usw.) orientiert wird, kann zu aktuellen Entwicklungen aufgeschlossen werden. Erste Resultate wurden von Werner Wegstein (Bayerische Julius-Maximilians Universität Würzburg) präsentiert. Er stellte ein für diese Plattform entwickeltes Kollationierungsmodul, einen Editor auf Eclipse-Basis, und dessen Einbettung in ein mögliches editorisches Szenario vor.
Schließlich hat sich Klaus Prätor (BBAW) mit einem "Ansatz zur hierarchischen, adaptiven Kollationierung" auseinandergesetzt. Seine Ausführungen bewegten sich um das automatisierte Auffinden gleicher bzw. ähnlicher Textpassagen. Gemeinsame "Aufsatzpunkte" stellen das Fundament dar, an dem entlang kollationiert wird. Sie beruhen auf der Struktur eines jeweiligen Textes und werden i.d.R. vom Editor im Transkriptionsprozess eingearbeitet. D.h. jede Edition schafft Gliederungsebenen, die im jeweiligen Fall als stabil erscheinen. Mithilfe entsprechender Algorithmen (nach Manber/Myers) und Tools (XML-Diff-Tools) ist es gegenüber dem manuellen Auffinden auch möglich, solche Punkte automatisch zu generieren.
Wolfgang Brunschön (BBAW) zeigte Arbeitsweisen im Editionsworkflow der Corpus Medicorum Graecorum/Latinorum (CMG/CML). Die Applikationen Microsoft Word, für die Erfassung, und TUSTEP, für die Verarbeitung von Editionsdaten, werden verknüpft. Zwar müsse relativ viel manuelle Arbeit geleistet werden, gleichwohl scheint es angesichts der Spezifik dieser Editionen kaum effizient, die digitale Kontrolle zu erhöhen.
Abschließend hat Gerald Neumann "Zur Paralleldarstellung von Textversionen" gesprochen und die digitalen Editionen von "Projekt des Monats" (http://www.bbaw.de/pom/pom.html) an der BBAW vorgestellt: seit Mai 2005 werden monatlich Daten bzw. Editionen aus einer der Arbeitsgruppen der BBAW für die Darstellung im digitalen Medium aufbereitet. Auf diese Weise entsteht eine digitale Akademiebibliothek. Da die Ausgangsmaterialen große Bandbreite besitzen, sind sehr unterschiedliche Anforderungen zu bewältigen. Auf die dynamische Verarbeitbarkeit und das Erproben moderner Technologien wird großer Wert gelegt. So bewähren sich etwa XML-Datenbanken (eXist mit XQuery und XSLT) und AJAX-Anwendungen. Im Laufe der Projektgeschichte hat sich der Blick auf Bildschirmeditionen und deren Charakteristik gegenüber dem gedruckten Buch geschärft. Sie bestehen u. a. in der klaren Ausdifferenzierung zwischen dem Datenvorhalt, den Neumann als "Möglichkeit eines Textes" versteht, und ihrer ad hoc generierten physischen Auszeichnung.
Ergebnisse
Im editorischen Workflow ist das Kollationieren ein Teilprozess, der als maßgebliches Verbindungsglied zwischen Vorlage bzw. Transkription und Editionsergebnis fungiert. Er berührt alle wichtigen Aspekte der Textdatenverarbeitung. Aus diesem Grund bot die Tagung mit einer Mischung aus punktuellen Ausschnitten aus Editionsvorhaben, Rückblenden in die Theorie und der Begründung technischer Sachverhalte einen Überblick derzeitiger Bedingungen digitalen Edierens. Die Verwendung digitaler Hilfsmittel wurde in den vergangenen Jahren und mit ihrer Weiterentwicklung selbstverständlich. Sie hat ein hohes technisches Niveau erreicht. Heute scheint es zunehmend notwendig, sich auf Standards hinsichtlich der Formate von Dokumenten und technischer Arbeitsmethoden zu verständigen. Nur auf diese Weise kann auf eine Wissenschaft, die sich mehr und mehr vernetzt, angemessen reagiert und können avancierte Technologien nutzbar gemacht werden.
Spezifische Probleme treten dem entgegen: Edition ist zuerst davon geprägt, Lösungen in überschaubarer Zeit anzubieten. Die Arbeit gerät beispielsweise durch den Produktionsbetrieb selbst, der immer auch einen nachfolgenden Editionsgegenstand im Blick hat, oder das Ablaufen eines Projektes unter Druck. Gleichzeitig müssen jeweils zur Verfügung stehende Ressourcen berücksichtigt werden. Normierungsbestrebungen sind diesbezüglich zweitrangig. Von daher kann es nicht überraschen, dass im entwickelten Editionsbetrieb proprietäre Lösungen herrschen.
Vorhaben wie Textgrid sind angesichts der beschriebenen Gegebenheiten wegweisend. Textgrid nimmt die Verwendung offener Standards (XML, TEI) als Voraussetzung und sucht oberhalb dessen nach gemeinsamen Schnittpunkten editorischen Vorgehens. Die Bedingungen neuer Medien und deren permanente Weiterentwicklung werden kalkuliert: der modulare Aufbau der Software gewährleistet die Ausbau- und Anpassungsfähigkeit gegenüber neuen Anforderungen. Daran angebunden können gesammelte Erfahrungen dazu dienen, die Weiterentwicklung genutzter Standards (bspw. Unicode) zu forcieren. Erst im Vorantreiben solcher Unternehmen kann beantwortet werden, in welchem Ausmaß auch sehr unterschiedlich gelagerte Editionsfälle unter einen Standard zu fassen sind bzw. wie minimal dieser ausfallen müsste, um für weitere Untersuchungen tragfähig zu bleiben.
Ein solches Vorhaben kann Erfolg versprechen, wenn sich die wissenschaftliche Community, aus der sich nicht zuletzt die Anwender rekrutieren, in die Entwicklung konstruktiv einschaltet und die Funktionalitäten der Module begleitend erprobt. Inwieweit eine solche Applikation angenommen wird, hängt dabei auch von den Maßgaben der Benutzerfreundlichkeit, der Gewährleistung heutiger Ansprüche an Barrierefreiheit (accessibility, usability) und einer quasi intuitiven Beherrschbarkeit ab. Die Realisation solcher Forderungen kann wesentlich zum Erfolg und zur Überwindung existierender Lösungen beitragen.
If there is additional discussion of this review, you may access it through the network, at: http://hsozkult.geschichte.hu-berlin.de/.
Citation:
Jan Lautenbach. Review of , Computergestützte Kollationierung und ihre Integration in den editorischen Arbeitsfluss.
H-Soz-u-Kult, H-Net Reviews.
June, 2006.
URL: http://www.h-net.org/reviews/showrev.php?id=28470
Copyright © 2006 by H-Net, Clio-online, and the author, all rights reserved. This work may be copied and redistributed for non-commercial, educational purposes, if permission is granted by the author and usage right holders. For permission please contact H-SOZ-U-KULT@H-NET.MSU.EDU.


