Publikationsserver des Instituts für Deutsche Sprache
Not a member yet
11061 research outputs found
Sort by
SdeWaC – A corpus of parsable sentences from the web
For a number of languages, web crawling allows researchers to collect huge text samples to build corpora. However, only part of the material found on the internet is useful for Natural Language Processing, as e.g. parsers typically cannot handle lists and tables, or very short or very long sentences. There are methods (cf. e.g. [3]) for cleaning the downloaded data before adding it to a corpus collection – but even when these are applied, not all remaining textual material might be suitable for certain research requirements. This paper describes methods utilized to prepare deWaC, a freely available German web corpus of the WaCky project, for automatic processing up to the parsing level. It then discusses ways in which this corpus, called SdeWaC, has been used since its release
Wie man in Italien über die deutsche Sprache dachte - und wie man heute denkt
Ausgehend von einer alten These des Essayisten und Literaturhistorikers Giulio Natali (1917), die eine grundsätzliche „antideutsche Haltung" der Italiener postulierte, wird in diesem Beitrag zuerst der Frage nachgegangen, ob es in Italien historisch begründete, herkömmliche Stereotype gibt, die das heutige Deutschlandbild zu beeinflussen vermögen (Kap. 1). Den Hauptteil dieser Arbeit bildet ein Exkurs über historisch belegte Meinungen der Italiener im Laufe der Geschichte der deutsch-italienischen Beziehungen (Kap. 2). Der Exkurs zielt darauf, ein besseres Verständnis für die heutige Situation zu gewinnen. Diese wird schließlich an den Ergebnissen einer kleinen Umfrage dargestellt, die zeigt, wie die jüngere „Erasmus"-Generation von heute, die sich in Italien für ein Deutschstudium entschieden hat, über die deutsche Sprache denkt (Kap. 3). Die Untersuchung ist u.a. durch die Vorstellung motiviert, dass Einstellungen über die deutsche Sprache Einfluss darauf haben, ob etwa ein Germanistik- oder DaF-Studium aufgenommen wird. Demgemäß könnte man sich die Frage stellen, woher bei jungen Italiener/inne/n der Bedarf entstehen soll, eine - wie Boccaccio sagte - „abscheuliche Sprache" zu lernen, welche vielleicht für Tiere und Teufel besser geeignet ist als für Menschen
Lessons learned from joining forces across disparate disciplines in the NFDI: the conference on research on text analytics. Presented at the 1st Conference on Research Data Infrastructure (CoRDI), Karlsruhe, 12. – 14. September 2023
This contribution summarizes the lessons learned from the organization of a joint conference on text analytics research by the Business, Economic, and Related Data (BERD@NFDI) and Text+ consortia within the National Research Data Infrastructure (NFDI) in Germany. The collaboration aimed to identify common ground and foster interdisciplinary dialogue between scholars in the humanities and in the business domain. The lessons learned include the importance of presenting research questions using textual data to establish common ground, similarities in methodology for processing textual data between the consortia, similarities in research data management, and the need for regular interconsortial discussions on textual analysis methods and data. The collaboration proved valuable for interdisciplinary dialogue within the NFDI, and further collaboration between the consortia is planned
„Da hawe wir Kontakt ghabt mit Armenen, mit eh… Grusine, mit Russen“. Sprachkontaktsituationen und -phänomene der Kaukasiendeutschen im Südkaukasus
Im Zentrum der Betrachtungen stehen Sprachkontaktsituationen sowie Sprachkontaktphänomene der Kaukasiendeutschen. Sie sind Nachfahren deutschstämmiger Einwohner des Russischen Reichs und der Sowjetunion, die ab Ende des 18. Jahrhunderts in mehreren Phasen in Gebiete Transkaukasiens ausgewandert sind. Bei der untersuchten Gruppe handelt es sich um diejenigen, die aufgrund von interethnischen Ehen von den Deportationen 1941 aus den deutschen Siedlungsgebieten ausgenommen waren und bis heute im Südkaukasus leben. Mithilfe soziolinguistischer Methoden wurden von der Autorin erstmalig 2017 formelle, leitfadengestützte Interviews im Südkaukasus mit der noch lebenden Erlebnisgeneration sowie einer Nachkommengeneration aufgenommen, transkribiert und ausgewertet. Im Beitrag werden Sprachkontaktkonstellationen deutscher Varietäten (Schwäbisch sowie standardnahes Deutsch) mit dem Russischen (und Georgischen) sowie Sprachkontaktphänomene vorgestellt
Konditionalität und Kausalität im Diskurs. Eine korpuslinguistische Studie zum Einfluss von Syntax und Prosodie auf die Interpretation komplexer Äußerungen
Das Werk versteht sich als eine Darstellung der wichtigsten syntaktischen, prosodischen, semantischen und pragmatischen Eigenschaften kausaler und konditionaler Konnektoren des gesprochenen Deutsch.
Die Untersuchung formuliert notwendige theoretische Grundlagen und zeigt die komplexe Interaktion mehrerer Faktoren, die sich auf die Interpretation einer Äußerung auswirken. Empirische Daten belegen, dass die kontextuelle und pragmatische Interpretation der untersuchten Relationen stark mit ihren syntaktischen und prosodischen Mustern korreliert. Jedoch handelt es sich nicht um eine Eins-zu-eins-Beziehung, denn gleiche Lesarten können von kausalen und konditionalen Relationen unterschiedlich markiert sein. Anhand der Ergebnisse wird das Verhältnis zwischen Konditionalität und Kausalität diskutiert
A coding scheme for (dis)approval-relevant events involving the direct social sanctioning of problematic behavior in informal social interaction
This manual introduces a conversation analytically informed coding scheme for episodes involving the direct social sanctioning of problem behavior in informal social interaction which was developed in the project Norms, Rules, and Morality across Languages (NoRM-aL) at the Leibniz-Institute for the German Language. It outlines the background for its development, delimits the phenomena to which the coding scheme can be applied and provides instructions for its use.
The scheme asks for basic information about the recording and the participants involved in the episode, before taking stock of different features of the sanctioning episode as a whole. This is followed by sets of specific coding questions about the sanctioning move itself (such as its timing and composition) and the reaction it engenders. The coding enables researchers to get a bird’s eye view on recurrent features of such episodes in larger quantities of data and allows for comparisons across different languages and informal settings
Keine Lingua franca – aber mehr als andere Sprachen: Deutsch im Baltikum als Ergänzungssprache der Gesellschaft
1. Ausgangspunkt: Wie lässt sich die gesellschaftliche Rolle von Sprachen charakterisieren?
2. Deutsch im Baltikum heute: Unterschiedliche Sprecher, viele Funktionen
3. Wissenschaftliche Analysen des Deutschen im Baltikum
4. Schlussfolgerungen: Deutsch als Ergänzungssprache der Gesellschaf
Warum haben wir das Plusquamperfekt, wenn es nie benutzt wird?
Frage von N. (11 Jahre)
Im Rahmen von Aktionstagen wie dem Girls' Day oder Türen auf mit der Maus haben Kinder die Möglichkeit, uns Fragen zu allem zu stellen, was sie an der deutschen Sprache interessiert. Die hier nachlesbare Frage mitsamt Antwort stammen aus diesen Quellen