Mit Bordmitteln riesige Textdatei durchsuchen

Suche mit less
Suche mit less
22.01.2013 11:01

Wer eine bestimmte Stelle in einer mehrere Gigabyte großen Textdatei auffinden möchte, kommt mit den herkömmlichen Texteditoren nicht besonders weit: Entweder laden diese eine solch große Datei gar nicht erst ein oder aber sie stürzen beim Ladevorgang ab. Die ganze Textflut mit dem Kommandozeilenprogramm more zu durchblättern, dürfte wohl nur etwas für Masochisten sein.

Der Autor selbst musste vor Kurzem ein im Laufe der Jahre gewachsenes E-Mail-Archiv durchsuchen. Gefragt war lediglich das Datum einer ganz bestimmten E-Mail. Um dieses aufzuspüren, kam zunächst grep in den Sinn:

grep "Biene Mayer" inbox

Das spuckt allerdings nur die Zeile mit dem Namen des Absenders aus.

Griffig

Um auch an die Betreff-Zeile und das Datum der entsprechenden E-Mail zu gelangen, mussten auch die Zeilen um die Fundstelle herum ausgegeben werden. Genau dafür kennt grep den Parameter -C:

grep -C 2 "Biene Mayer" inbox

Dieser Befehl liefert auch die zwei Zeilen vor, sowie die zwei Zeilen nach dem Absender – mit anderen Worten also auch die vier Zeilen um die Fundstelle herum.

Bei vielen großen Textdateien dürfte man damit schon ans Ziel gelangen. Hier gab es jedoch im E-Mail-Archiv gleich mehrere E-Mails von Biene Mayer. grep spuckt somit alle Fundstellen aus. Diese sind zwar jeweils durch mehrere Bindestriche getrennt ----, bei der entstehenden Textflut war das aber nicht besonders hilfreich. Nur die erste Fundstelle liefert grep, wenn man noch den Parameter -m 1 anhängt:

grep -m 1 -C 2 "Biene Mayer" inbox

Dummerweise war das jedoch nicht die gesuchte E-Mail. Man könnte jetzt viel Hirnschmalz in das Suchmuster stecken oder zu speziellen grep-Alternativen greifen (beim Durchsuchen von großen E-Mail-Archiven hilft beispielsweise das darauf spezialisierte grepmail [1]).

less durchsucht auch große Dateien.

Weniger ist mehr

Das alles ist jedoch gar nicht nötig, denn auf der Festplatte schlummert bei den meisten Distributionen less. Dieser more-Ersatz durchsucht auch beliebig große Textdateien. Dazu setzt man less schlicht auf die Textdatei an:

less inbox

tippt einen Schrägstrich / (via [Umschalt+7]), gibt an der erscheinenden Kommandozeile das gesuchte Wort ein (im Beispiel Biene Mayer) und drückt die Eingabetaste. Damit landet man automatisch beim ersten Treffer. [N] springt jetzt zum nächsten Treffer, [Umschalt+N] zum vorherigen zurück. Wie gewohnt kann man mit den Pfeiltasten nach oben und unten oder seitenweise mit [Bild auf] und [Bild ab] blättern.

Es gibt natürlich noch weitere Möglichkeiten, eine riesige Textdatei nach einem Begriff zu durchpflügen, grep und less dürften für die meisten schnellen Suchen allerdings schon ausreichen.

Infos

[1] Axel Beckert, Frank Hofmann, „Durchkämmt“ – Suche in Datenformaten (Teil 2), LinuxUser, Ausgabe 7/2012:
http://www.linux-community.de/Internal/Artikel/Print-Artikel/LinuxUser/2012/07/Suche-in-Datenformaten-Teil-2/


Kommentare
useless use of cat
Chris (unangemeldet), Dienstag, 22. Januar 2013 13:43:25
Ein/Ausklappen

cat inbox |

Ist völlig unnötig.
grep "Biene Mayer" inbox



Bewertung: 175 Punkte bei 328 Stimmen.
Den Beitrag bewerten: Gut / Schlecht
-
Re: useless use of cat
Tim Schürmann, Mittwoch, 23. Januar 2013 00:01:24
Ein/Ausklappen

Stimmt, Danke für den Hinweis. Ich lasse es im Text aber jetzt erstmal so stehen.

(Ich habe in der letzten Zeit eindeutig zu viel mit der Pipe arbeiten müssen... :))


Bewertung: 330 Punkte bei 259 Stimmen.
Den Beitrag bewerten: Gut / Schlecht
-
Re: useless use of cat
Jörg Meier (unangemeldet), Donnerstag, 24. Januar 2013 06:08:50
Ein/Ausklappen

> Ich lasse es im Text aber jetzt erstmal so stehen.

Warum? Weil es so schön diletantisch aussieht?



Bewertung: 364 Punkte bei 249 Stimmen.
Den Beitrag bewerten: Gut / Schlecht
-
Re: useless use of cat
Tim Schürmann, Donnerstag, 24. Januar 2013 10:35:01
Ein/Ausklappen

> Warum?

Weil es den Kommentar erklärt. Ich werde es dann aber jetzt ändern.

> Weil es so schön diletantisch aussieht?

Warum diletantisch? Es ist eine weitere (erlaubte) Möglichkeit, "grep" die zu untersuchenden Informationen zuzuführen. Die Textdatei muss "grep" sowieso einmal komplett durchgehen. Von der Geschwindigkeit dürfte das zudem auf modernen Rechnern keinen großen Unterschied machen.


Bewertung: 298 Punkte bei 378 Stimmen.
Den Beitrag bewerten: Gut / Schlecht

Kommentare
useless use of cat
Chris (unangemeldet), Dienstag, 22. Januar 2013 13:43:25
Ein/Ausklappen
-
Re: useless use of cat
Tim Schürmann, Mittwoch, 23. Januar 2013 00:01:24
Ein/Ausklappen
-
Re: useless use of cat
Jörg Meier (unangemeldet), Donnerstag, 24. Januar 2013 06:08:50
Ein/Ausklappen

> Ich lasse es im Text aber jetzt erstmal so stehen.

Warum? Weil es so schön diletantisch aussieht?



Bewertung: 364 Punkte bei 249 Stimmen.
Den Beitrag bewerten: Gut / Schlecht
-
Re: useless use of cat
Tim Schürmann, Donnerstag, 24. Januar 2013 10:35:01
Ein/Ausklappen

Aktuelle Fragen

Bash - verschachtelte Variablenersetzung, das geht doch eleganter als meine Lösung?
Josef Federl, 18.07.2017 20:24, 1 Antworten
#!/bin/bash #Ziel des Skriptes wird sein die ID zu extrahieren hier nur als Consolentest: root@...
Speicherplatzfreigabe mit "sudo apt-get clean" scheitert
Siegfried Böttcher, 16.07.2017 21:16, 2 Antworten
Speicherplatzfreigabe mit "sudo apt-get clean" scheitert, weil aus mir unerfindlichen Gründen im...
Möchte Zattoo vom PC am Fernsehgerät sehen können
Ilona Nikoui, 15.07.2017 18:25, 3 Antworten
Hallo, ich habe mein Fernsehgerät, ein LG 26LE3300 mit dem PC verbunden per HDMI Kabel, wie empfo...
TUXEDO und Hardwareauswahl , fragwürdig / Kritik
Josef Federl, 11.07.2017 12:44, 6 Antworten
Auf tuxedocomputers.com steht: "....Aber wir können auch Linux und das so, dass "einfach" alles...
HP PHOTOSMART 5525 nimmt die schwarze original patrone nicht
Erich Mecl, 28.06.2017 18:10, 1 Antworten
Hallo Leute! Mein HP Photosmart 5525 Drucker erkennt die original schwarze Patrone 364, nimmt s...

Jetzt auf den Mailinglisten

Re: [EasyLinux-Ubuntu] GDM3 nach Dist-Upgrade Debian 8 Jessie auf Debian 9 Stretch
Heiko Ißleib, 21.07.2017 14:34
Hallo. Also bei mir Plasma5 und xfce tut sddm seinen dienst.xdm wurde mitinstalliert.Gdm wurde nicht instal...
Re: [EasyLinux-Ubuntu] Linux.Fibel.org im Internet
Nguyen Dong Loan, 21.07.2017 12:33
Am Dienstag, den 18.07.2017, 11:53 +0200 schrieb Alfred Zahlten: > > > http://www.fibel.org/li...
Re: [EasyLinux-Ubuntu] GDM3 nach Dist-Upgrade Debian 8 Jessie auf Debian 9 Stretch
Karl-Heinz, 21.07.2017 10:49
Am Thu, 20 Jul 2017 19:25:32 +0200 schrieb Karl-Heinz : Hallo Leute, das war mein erster Eindruck. Der...
[EasyLinux-Ubuntu] VirtualBox nach Dist-Upgrade Debian 8 Jessie auf Debian 9 Stretch
Karl-Heinz, 20.07.2017 19:25
Hallo zusammen, heute das Dist-Upgrade von Jessie zu Stretch hinter mich gebracht. Tod langweileig und man...
Re: [EasyLinux-Ubuntu] Kubuntu/Mandriva Live - Gibt's das auch in funktionierend ?
Willi Zelinka, 20.07.2017 14:14
Hallo Stephan, Am Mittwoch, 19. Juli 2017, 20:24:18 CEST schrieb Stephan Goldenberg: > On 19.07.2017 17:...

Infos zur Publikation