(corpus-collection_intro)=
# Korpusaufbau. Auswählen, sammeln, dokumentieren

````{margin}
```{admonition} Fragen oder Feedback 
:class: frage-feedback

<a href="https://github.com/quadriga-dk/Text-Fallstudie-1/issues/new?assignees=&labels=question&projects=&template=frage.yml" class="external-link" target="_blank">
    Stellen Sie eine Frage.
</a> <br>
<a href="https://github.com/quadriga-dk/Text-Fallstudie-1/issues/new?assignees=&labels=feedback&projects=&template=feedback.yml" class="external-link" target="_blank">
    Geben Sie uns Feedback.
</a>

Mit Ihren Rückmeldungen können wir unser interaktives Lehrbuch gezielt an Ihre Bedürfnisse anpassen.

```
````

`````{margin}
````{admonition} Zitierhinweis
:class: citation-information
```{literalinclude} /CITATION.bib
:language: bibtex
```
Skorinkin, D., Sluyter-Gäthje, H. & Trilcke, P. (2024). _Quantitative Analyse der Medienwellen der Spanischen Grippe (1918/19). Eine Fallstudie._ https://doi.org/10.5281/zenodo.15682652

`````

```{include} ../introduction/learning-outcomes.md
:start-after: "<!-- START: Korpusaufbau. Auswählen, sammeln, dokumentieren -->"
:end-before: "<!-- END: Korpusaufbau. Auswählen, sammeln, dokumentieren -->"
```

Nachdem im [vorherigen Kapitel](../research_question/research-question_research-question) die **Fragestellung** dieser Fallstudie und deren **Operationalisierung** erläutert wurden, muss nun der Forschungsgegenstand im Sinne der Operationalisierung vorbereitet werden. In unserem Fall bedeutet dies, dass wir ein **Korpus zusammenstellen** müssen, anhand dessen sich (wie es in unserer Operationalisierung heißt) „die Texte in Berliner Tageszeitungen“ untersuchen lassen. 


```{figure} ../assets/images/flow-chart_corpus-collection.png
---
name: flussdiagramm-corpus-collection
---
Flussdiagramm der Fallstudie. Wir befinden uns nun im zweiten Arbeitspaket.
```

In diesem Kapitel nehmen wir zunächst eine [Sicherung des Begriffsverständnisses](corpus-collection_corpora-as-research-objects) vor und klären entsprechend, was wir mit dem Begriff „Korpus“ meinen und welche unterschiedlichen Typen des Korpusaufbaus es gibt. 

In einem anschließenden Schritt betrachten wir [unterschiedliche Erscheinungsformen von „Text“](corpus-collection_text_as_digital_objects) im digitalen Raum. Dabei lernen wir unterschiedliche Formate wie pdf, txt, xml oder csv und deren Vor- und Nachteile kennen.

Um ein Korpus und seine Elemente zu beschreiben, bedarf es [Metadaten](corpus-collection_metadata). Wir werden uns entsprechend in einem folgenden Schritt rudimentär mit dem Konzept von Metadaten befassen und ein basales Metadaten-Schema für unser Korpus und für die Elemente in unserem Korpus entwickeln.

In einem abschließenden Schritt geht es dann um den [Aufbau des Forschungskorpus](corpus-collection_building-our-corpus) für die folgenden Untersuchungen: Wir definieren zunächst, welche Objekte ins Korpus aufgenommen werden sollen, erarbeiten dann die Metadaten für die Korpusobjekte und laden schließlich die Dateien für das Korpus herunter. 
