Удалить из текстового файла перенос строки
Если вы когда-нибудь копировали и вставляли в документ Word текст из обычного текстового документа (особенно из служебных описательных файлов), то могли заметить, что в редакторе текст отображается как стихотворение - столбиком. Примерно вот так:
Try this fast and small color picker
designed for Webmasters and Designers.
Enjoy with colors.
Чтобы превратить расположение данного текста в нормальное (расположить по всей ширине страницы), нужно избавиться от разрывов строк. Обращаю ваше внимание, что такой способ может помочь не во всех случаях и применять его нужно осторожно, чтобы не слить весь текст в один сплошной абзац.
Чтобы проверить, а есть ли здесь разрыв строки, нажмите кнопку Непечатаемые символы (Show/Hide) на панели инструментов. В тексте отобразятся символы форматирования. Разрыв строки обозначается таким символом . Если на концах строк у вас отображается иной символ, например , то это символ абзаца. И для его удаления потребуется иной знак в поле Найти , о чем будет сказано ниже.
Итак, для удаления разрыва строк в тексте вам необходимо:
После этой операции откроется окно с уведомлением о количестве произведенных замен и предложением проверить остальную часть документа. Если дальнейшая замена не требуется, откажитесь от неё и закройте диалоговое окно.
Текст примет нормальный вид и займёт всю ширину страницы.
В том случае, если вместо знака разрыва строки у вас имеется абзацный разрыв, то для его удаления в диалоговом окне Найти и заменить необходимо снять все флажки с параметров поиска, в том числе и с параметра Подстановочные знаки. В поле Найти нужно вставить символ абзаца, выбрав его из списка по щелчку на кнопке Специальный. Дальнейшие действия аналогичны описанным выше.
Если вы часто производите такие замены, то логично будет оформить весь приведенный здесь процесс в виде макроса и разместить кнопку макроса на панели форматирования для быстрого доступа к нему.
Вы можете помочь в развитии сайта, сделав пожертвование:
--> Или помочь сайту популярной криптовалютой:
BTC Адрес: 1Pi3a4c6sJPbfF2sSYR2noy61DMBkncSTQ
ETH Адрес: 0x7d046a6eaa1bd712f7a6937b042e9eee4998f634
LTC Адрес: LUyT9HtGjtDyLDyEbLJZ8WZWGYUr537qbZ
USDT (ERC-20) Адрес: 0x7d046a6eaa1bd712f7a6937b042e9eee4998f634
Яндекс Деньги: 410013576807538
А тут весь список наших разных крипто адресов, может какой добрый человек пожертвует немного монет или токенов - получит плюсик в карму от нас :) Благо Дарим, за любую помощь! -->
Доброго времени суток. Имеется огромный текстовый файл, нужно удалить все переносы строк.
Удалить переносы строк в файле
Нужен код программы который будет считывать с файла стихотворение( 2 четверостишья) вот пример .
Удалить в текстовом файле перенос строк
Здравствуйте! Как удалить в текстовом файле разрыв страницы !? Спасибо
Оставить в текстовом файле 20 строк, остальные удалить
есть файл .txt с бесконечным числом строк. как оставить в нем первые 20, а остальные удалить?
Удалить в текстовом файле символы-разделители в конце строк
Прошу помощи у хороших знатаков библиотеки cstdio, C++. Вроде бы задача не сложная, но никак не.
Решение
А какая версия powershell? Что выдает:
Поставил полные пути (C:\test\1.txt;C:\test\2.txt) ошибка та же.
Решение
Тогда попробуйте такую конструкцию:
- склеивание строк может привести к исключению, по причине превышения допустимой длины строки. (например, переполнение памяти и т.д.)
В файле в base64 убрать переносы, тем самым сократить размер.
Я даже перепугался . а вдруг у меня с теоретическим анализом что-то поломалось, по причине старческого маразма. на практике ведь не проверял.
1. Само построение предложения предполагает варианты, т.е. как "может", так и "может не". А вот "не может" - это уже существенное ограничение.
2. Склеивание таки там есть, ибо как раз это и указано в условии задачи. И именно это же присутствует в коде, в виде оператора -join .
3. Само предположение возникло в виду недостаточности исходных данных. При таком количестве строк (до 100000 строк и к тому же расплывчатое: "огромный" файл), длина строк совсем не указана, а в коде, итоговая, причем единственная, строка не имеет ограничения по своей длине. собственно, поэтому и получился такой вывод.
ЗЫ Возможно, я заблуждаюсь по поводу StreamWriter (на истину в последней инстанции не претендую), он ведь сбрасывает данные в файл, но кто его знает, что там ему вздумается при склеивании-то.
У меня есть текстовый файл с фиксированной шириной, поэтому он содержит начальные нули и пробелы, и мне нужно удалить символы возврата каретки и перевода строки из файла. Не могли бы вы сообщить мне, как я могу это сделать с помощью пакетного скрипта?
Нет тривиального чисто пакетного решения, если у вас есть строки, которые могут начинаться с пробелов. Такие строки можно писать без новой строки , но для этого потребуется много кода.
Есть и другие проблемы, которые могут еще больше усложнить чистое пакетное решение.
В общем, пакетная программа Windows - плохой выбор для работы с текстовыми файлами, если вам нужно надежное универсальное решение,
Вот почему я написал JREPL.BAT - утилиту для обработки текста с регулярными выражениями . JREPL - это чистый сценарий (гибридный пакет / JScript), который изначально запускается на любой машине Windows, начиная с XP. Никаких сторонних exe-файлов не требуется.
Полная документация доступна из командной консоли через jrepl /? или jrepl /?? для постраничного вывода.
Решение с JREPL совершенно тривиально.
Если вы хотите перезаписать исходный файл, тогда
Это решение будет работать до тех пор, пока весь ваш файл может быть прочитан в память с помощью JScript. Я считаю, что лимит приближается к 1 гигабайту.
Обновление 2020-07-14
Ограничение размера было снято, начиная с версии 8.5 JREPL, выпущенной 29 февраля 2020 г. В предыдущих версиях требовалась /M возможность загрузки всего файла в память. Версия 8.5 вводит /EOL параметр, который определяет последовательность конца строки, которая будет использоваться при записи каждой строки. В качестве значения можно установить пустую строку, тем самым удалив все символы возврата каретки и перевода строки, и это достигается обработкой одной строки за раз.
Версия AutoIt:
3.3.0.0
Описание:
Как удалить последнюю строку текстового файла?
Циклом считаю количество строк; в ini-файле беспроблемно убрал бы строку, но файл-то не ini-шный, а вовсе txt-шный.
Примечания:
Вот такая строка меня бы устроила целиком и полностью:
$linia=FileDeleteLine($file, $nmer);
вся беда в том, что в AutoIt-е НЕТ такой функции: FileDeleteLine .
Если можно, кусочек кода приветствуется! ;)
joiner
Модератор
gregaz
AutoIT Гуру
CreatoR
Must AutoIt!
CreatoR
Must AutoIt!
Её можно сделать:
Core2Duo
второйц вариант кода- оч большой по сравнению с первым,его навернон заминусуют.
Новичку, открывшему тему - Автоиту параллельно (||) что ты пишеш INI-данные не в фаил с расширением INI. пиши хоть в EXE или BIN , все арвно автоит при чтении открывает фаил кака RAW, то есть как будто блокнотом (назовем это так). так что проьлема удаления строки навернон для тебясама отпала. вот
Плюсуйте :-[
akoulev
Новичок
У меня, кстати, и имя есть. И твоя лень посмотреть на него, уважаемый Core2Duo, воспринимается как-то. безрадостно. ;(
Автоиту параллельно (||) что ты пишеш INI-данные не в фаил с расширением INI. пиши хоть в EXE или BIN , всё равно, AutoIt при чтении открывает фаил как RAW, то есть "как будто блокнотом" .
Это было БЫ так - если забыть о специфическом формате ini-файла, где, вроде как, должен быть заголовок ([в квадратных скобках]) и ещё + обязательная нумерация строк.
CreatoR
Must AutoIt!
Core2Duo
[warn title=Предупреждение]За нарушение правил форума пункт В.8:
8. Так как эта конференция называется "Русское сообщество AutoIt", язык общения на ней - Русский. Названия фирм или программных продуктов, аббревиатуры и т.д. должны быть написаны так, как они пишутся в оригинале, например не следует писать УСБ вместо USB. На форуме крайне не рекомендуется намеренно искажать русский язык и использовать "сетевой жаргон" на подобии "Аффтар выпей йадау!".
Core2Duo
да че ты мне про синтаксис то рассказываешь !? как будто я сам не знаю. INI еще наплевать на то, сколькими пустыми строками разделены переменные в блоке и как далеко они от блока.
akoulev
Новичок
Я знаю, что ты знаешь. ;) Но ты (не я! ;D) предложил обрабатывать текстовый файл, как ini-шный; а я показал, ПОЧЕМУ это невозможно. (Ибо не во всех текстовых файлах этой несчастной планеты строки пронумерованы! Ой! Один старый добрый злой знакомый сказал бы, что эта фраза - депрессивна. Тогда - так: не во всех текстовых файлах этой счастливой планеты строки пронумерованы! :D)
INI еще наплевать на то, сколькими пустыми строками разделены переменные в блоке и как далеко они от блока.
kaster
Мой Аватар, он лучший самый
что-то я не понял про нумерацию строк ;D
в ини файле строки тоже не нумеруются. если только сам этим не озадачишься.
akoulev
Новичок
ArtInt
Знающий
Извиняюсь за некропостинг
У меня возникли некоторые проблемы при использовании данной функции. Скажите - это моя ошибка или функции? Вроде параметры передаются правильные.
AZJIO
Меценат
ArtInt
Мой вариант
CreatoR
Must AutoIt!
inververs
AutoIT Гуру
ArtInt
Знающий
inververs
Твой вариант работает как надо, однако при использовании в таком контексте:
Скрипт виснет намертво. Видимо проблема с записью в файл, но почему?
CreatoR Так-то я дал ссылку на пример в теме.
Вместо 1-й и 2-й строки удаляет 1-ю и 3-ю. При этом параметры именно 1 и 2.
AZJIO
У Вас нумерация строк с конца? 0_о
AZJIO
Меценат
Да. Я исходил из названия заголовка темы. Как можно удалять по номеру строки если неизвестно сколько строк в файле. Какая будет последняя? Если считать количество строк это работает медленнее, чем просто удалить последнюю строку.
Даже если бы пришлось вырезать строку по номеру, всё равно бы использовал StringInStr : ищем перенос строки по номеру, от полученной позиции ищем второй перенос строки, потом склеиваем левую и правую часть, это всё же должно быстрей работать, чем склеивать множество раз в цикле.
Регулярное выражение думаю тоже быстро отработает.
В прошлый раз мы говорили о функциях в bash-скриптах, в частности, о том, как вызывать их из командной строки. Наша сегодняшняя тема — весьма полезный инструмент для обработки строковых данных — утилита Linux, которая называется sed. Её часто используют для работы с текстами, имеющими вид лог-файлов, конфигурационных и других файлов.
Если вы, в bash-скриптах, каким-то образом обрабатываете данные, вам не помешает знакомство с инструментами sed и gawk. Тут мы сосредоточимся на sed и на работе с текстами, так как это — очень важный шаг в нашем путешествии по бескрайним просторам разработки bash-скриптов.
Сейчас мы разберём основы работы с sed, а так же рассмотрим более трёх десятков примеров использования этого инструмента.
Основы работы с sed
Утилиту sed называют потоковым текстовым редактором. В интерактивных текстовых редакторах, наподобие nano, с текстами работают, используя клавиатуру, редактируя файлы, добавляя, удаляя или изменяя тексты. Sed позволяет редактировать потоки данных, основываясь на заданных разработчиком наборах правил. Вот как выглядит схема вызова этой команды:
По умолчанию sed применяет указанные при вызове правила, выраженные в виде набора команд, к STDIN . Это позволяет передавать данные непосредственно sed.
Вот что получится при выполнении этой команды.
Простой пример вызова sed
В данном случае sed заменяет слово «test» в строке, переданной для обработки, словами «another test». Для оформления правила обработки текста, заключённого в кавычки, используются прямые слэши. В нашем случае применена команда вида s/pattern1/pattern2/ . Буква «s» — это сокращение слова «substitute», то есть — перед нами команда замены. Sed, выполняя эту команду, просмотрит переданный текст и заменит найденные в нём фрагменты (о том — какие именно, поговорим ниже), соответствующие pattern1 , на pattern2 .
Выше приведён примитивный пример использования sed, нужный для того, чтобы ввести вас в курс дела. На самом деле, sed можно применять в гораздо более сложных сценариях обработки текстов, например — для работы с файлами.
Ниже показан файл, в котором содержится фрагмент текста, и результаты его обработки такой командой:
Текстовый файл и результаты его обработки
Здесь применён тот же подход, который мы использовали выше, но теперь sed обрабатывает текст, хранящийся в файле. При этом, если файл достаточно велик, можно заметить, что sed обрабатывает данные порциями и выводит то, что обработано, на экран, не дожидаясь обработки всего файла.
Выполнение наборов команд при вызове sed
Для выполнения нескольких действий с данными, используйте ключ -e при вызове sed. Например, вот как организовать замену двух фрагментов текста:
Использование ключа -e при вызове sed
К каждой строке текста из файла применяются обе команды. Их нужно разделить точкой с запятой, при этом между окончанием команды и точкой с запятой не должно быть пробела.
Для ввода нескольких шаблонов обработки текста при вызове sed, можно, после ввода первой одиночной кавычки, нажать Enter, после чего вводить каждое правило с новой строки, не забыв о закрывающей кавычке:
Вот что получится после того, как команда, представленная в таком виде, будет выполнена.
Другой способ работы с sed
Чтение команд из файла
Если имеется множество команд sed, с помощью которых надо обработать текст, обычно удобнее всего предварительно записать их в файл. Для того, чтобы указать sed файл, содержащий команды, используют ключ -f :
Вот содержимое файла mycommands :
Вызовем sed, передав редактору файл с командами и файл для обработки:
Результат при вызове такой команды аналогичен тому, который получался в предыдущих примерах.
Использование файла с командами при вызове sed
Флаги команды замены
Внимательно посмотрите на следующий пример.
Вот что содержится в файле, и что будет получено после его обработки sed.
Исходный файл и результаты его обработки
Команда замены нормально обрабатывает файл, состоящий из нескольких строк, но заменяются только первые вхождения искомого фрагмента текста в каждой строке. Для того, чтобы заменить все вхождения шаблона, нужно использовать соответствующий флаг.
Схема записи команды замены при использовании флагов выглядит так:
Выполнение этой команды можно модифицировать несколькими способами.
- При передаче номера учитывается порядковый номер вхождения шаблона в строку, заменено будет именно это вхождение.
- Флаг g указывает на то, что нужно обработать все вхождения шаблона, имеющиеся в строке.
- Флаг p указывает на то, что нужно вывести содержимое исходной строки.
- Флаг вида w file указывает команде на то, что нужно записать результаты обработки текста в файл.
Вызов команды замены с указанием позиции заменяемого фрагмента
Тут мы указали, в качестве флага замены, число 2. Это привело к тому, что было заменено лишь второе вхождение искомого шаблона в каждой строке. Теперь опробуем флаг глобальной замены — g :
Как видно из результатов вывода, такая команда заменила все вхождения шаблона в тексте.
Глобальная замена
Флаг команды замены p позволяет выводить строки, в которых найдены совпадения, при этом ключ -n , указанный при вызове sed, подавляет обычный вывод:
Как результат, при запуске sed в такой конфигурации на экран выводятся лишь строки (в нашем случае — одна строка), в которых найден заданный фрагмент текста.
Использование флага команды замены p
Воспользуемся флагом w , который позволяет сохранить результаты обработки текста в файл:
Сохранение результатов обработки текста в файл
Хорошо видно, что в ходе работы команды данные выводятся в STDOUT, при этом обработанные строки записываются в файл, имя которого указано после w .
Символы-разделители
Представьте, что нужно заменить /bin/bash на /bin/csh в файле /etc/passwd . Задача не такая уж и сложная:
Однако, выглядит всё это не очень-то хорошо. Всё дело в том, что так как прямые слэши используются в роли символов-разделителей, такие же символы в передаваемых sed строках приходится экранировать. В результате страдает читаемость команды.
К счастью, sed позволяет нам самостоятельно задавать символы-разделители для использования их в команде замены. Разделителем считается первый символ, который будет встречен после s :
В данном случае в качестве разделителя использован восклицательный знак, в результате код легче читать и он выглядит куда опрятнее, чем прежде.
Выбор фрагментов текста для обработки
До сих пор мы вызывали sed для обработки всего переданного редактору потока данных. В некоторых случаях с помощью sed надо обработать лишь какую-то часть текста — некую конкретную строку или группу строк. Для достижения такой цели можно воспользоваться двумя подходами:
- Задать ограничение на номера обрабатываемых строк.
- Указать фильтр, соответствующие которому строки нужно обработать.
Обработка только одной строки, номер который задан при вызове sed
Второй вариант — диапазон строк:
Обработка диапазона строк
Кроме того, можно вызвать команду замены так, чтобы файл был обработан начиная с некоей строки и до конца:
Обработка файла начиная со второй строки и до конца
Для того, чтобы обрабатывать с помощью команды замены только строки, соответствующие заданному фильтру, команду надо вызвать так:
По аналогии с тем, что было рассмотрено выше, шаблон передаётся перед именем команды s .
Обработка строк, соответствующих фильтру
Тут мы использовали очень простой фильтр. Для того, чтобы в полной мере раскрыть возможности данного подхода, можно воспользоваться регулярными выражениями. О них мы поговорим в одном из следующих материалов этой серии.
Удаление строк
Утилита sed годится не только для замены одних последовательностей символов в строках на другие. С её помощью, а именно, используя команду d , можно удалять строки из текстового потока.
Вызов команды выглядит так:
Мы хотим, чтобы из текста была удалена третья строка. Обратите внимание на то, что речь не идёт о файле. Файл останется неизменным, удаление отразится лишь на выводе, который сформирует sed.
Удаление третьей строки
Если при вызове команды d не указать номер удаляемой строки, удалены будут все строки потока.
Вот как применить команду d к диапазону строк:
Удаление диапазона строк
А вот как удалить строки, начиная с заданной — и до конца файла:
Удаление строк до конца файла
Строки можно удалять и по шаблону:
Удаление строк по шаблону
При вызове d можно указывать пару шаблонов — будут удалены строки, в которых встретится шаблон, и те строки, которые находятся между ними:
Удаление диапазона строк с использованием шаблонов
Вставка текста в поток
С помощью sed можно вставлять данные в текстовый поток, используя команды i и a :
- Команда i добавляет новую строку перед заданной.
- Команда a добавляет новую строку после заданной.
Теперь взглянем на команду a :
Как видно, эти команды добавляют текст до или после данных из потока. Что если надо добавить строку где-нибудь посередине?
Тут нам поможет указание номера опорной строки в потоке, или шаблона. Учтите, что адресация строк в виде диапазона тут не подойдёт. Вызовем команду i , указав номер строки, перед которой надо вставить новую строку:
Команда i с указанием номера опорной строки
Проделаем то же самое с командой a :
Команда a с указанием номера опорной строки
Обратите внимание на разницу в работе команд i и a . Первая вставляет новую строку до указанной, вторая — после.
Замена строк
Команда c позволяет изменить содержимое целой строки текста в потоке данных. При её вызове нужно указать номер строки, вместо которой в поток надо добавить новые данные:
Замена строки целиком
Если воспользоваться при вызове команды шаблоном в виде обычного текста или регулярного выражения, заменены будут все соответствующие шаблону строки:
Замена строк по шаблону
Замена символов
Команда y работает с отдельными символами, заменяя их в соответствии с переданными ей при вызове данными:
Замена символов
Используя эту команду, нужно учесть, что она применяется ко всему текстовому потоку, ограничить её конкретными вхождениями символов нельзя.
Вывод номеров строк
Если вызвать sed, использовав команду = , утилита выведет номера строк в потоке данных:
Вывод номеров строк
Потоковый редактор вывел номера строк перед их содержимым.
Если передать этой команде шаблон и воспользоваться ключом sed -n , выведены будут только номера строк, соответствующих шаблону:
Вывод номеров строк, соответствующих шаблону
Чтение данных для вставки из файла
Выше мы рассматривали приёмы вставки данных в поток, указывая то, что надо вставить, прямо при вызове sed. В качестве источника данных можно воспользоваться и файлом. Для этого служит команда r , которая позволяет вставлять в поток данные из указанного файла. При её вызове можно указать номер строки, после которой надо вставить содержимое файла, или шаблон.
Вставка в поток содержимого файла
Тут содержимое файла newfile было вставлено после третьей строки файла myfile .
Вот что произойдёт, если применить при вызове команды r шаблон:
Использование шаблона при вызове команды r
Содержимое файла будет вставлено после каждой строки, соответствующей шаблону.
Пример
Представим себе такую задачу. Есть файл, в котором имеется некая последовательность символов, сама по себе бессмысленная, которую надо заменить на данные, взятые из другого файла. А именно, пусть это будет файл newfile , в котором роль указателя места заполнения играет последовательность символов DATA . Данные, которые нужно подставить вместо DATA , хранятся в файле data .
Решить эту задачу можно, воспользовавшись командами r и d потокового редактора sed:
Замена указателя места заполнения на реальные данные
Как видите, вместо заполнителя DATA sed добавил в выходной поток две строки из файла data .
Итоги
Сегодня мы рассмотрели основы работы с потоковым редактором sed. На самом деле, sed — это огромнейшая тема. Его изучение вполне можно сравнить с изучением нового языка программирования, однако, поняв основы, вы сможете освоить sed на любом необходимом вам уровне. В результате ваши возможности по обработке с его помощью текстов будет ограничивать лишь воображение.
На сегодня это всё. В следующий раз поговорим о языке обработки данных awk.
Читайте также: