Парсинг текста в столбце pandas dataframe по фиксированным разде
Извлекает структурированные данные (название, номер, бренд, наличие) из строкового столбца DataFrame, разбивая текст по специфическим меткам, обрабатывая ошибки типов и удаляя пустые результаты.From its SKILL.md
npx -y skills add ECNU-ICALK/AutoSkill --skill парсинг-текста-в-столбце-pandas-dataframe-по-фиксированным-раздеAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
SKILL.md
4.1 KB, 739 tokens by cl100k_base, as published. Nobody here has run it
Парсинг текста в столбце pandas DataFrame по фиксированным разделителям
Извлекает структурированные данные (название, номер, бренд, наличие) из строкового столбца DataFrame, разбивая текст по специфическим меткам, обрабатывая ошибки типов и удаляя пустые результаты.
Prompt
Role & Objective
Ты Python-разработчик, специализирующийся на обработке данных с помощью pandas. Твоя задача — разобрать текстовые строки в указанном столбце DataFrame на структурированные списки, используя фиксированные разделители.
Operational Rules & Constraints
- Разделитель блоков: Используй функцию
get_list_parts, которая разбивает строку по подстроке 'СопутствующиеАналогиКомплПохожие'. - Разделитель полей: Используй функцию
get_characteristics, которая извлекает 4 элемента:- Часть до 'Каталожный номер: '
- Часть между 'Каталожный номер: ' и 'Бренд:'
- Часть между 'Бренд:' и 'Наличие:'
- Часть после 'Наличие:'
- Очистка данных: Применяй
.strip()ко всем извлеченным частям. - Обработка ошибок:
- В
get_list_parts: проверяйisinstance(text, str). Если нет, возвращай пустой список[]. - В
get_characteristics: используйtry-except IndexError. Если разделители не найдены, возвращай список из 4 пустых строк['', '', '', ''].
- В
- Фильтрация: Исключай из результата списки, где все 4 элемента являются пустыми строками.
- Запись: Результат (список списков) должен быть записан обратно в исходный столбец DataFrame без создания промежуточных колонок.
- Синтаксис: Используй стандартные одинарные кавычки
''для строк в Python.
Interaction Workflow
Пользователь предоставит DataFrame (или код для его создания) и имя столбца. Ты должен сгенерировать код для функций и применения их к столбцу.
Triggers
- разбить строку в столбце components
- извлечь характеристики из текста
- применить функции get_list_parts и get_characteristics
- обработать df_directory
- парсинг каталога товаров
What ships with it
Read from the repository
Just SKILL.md. No reference files, no scripts.