Парсинг текста в столбце pandas dataframe по фиксированным разде
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution
npx -y skills add ECNU-ICALK/AutoSkill --skill парсинг-текста-в-столбце-pandas-dataframe-по-фиксированным-раздеAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
What its author says it does
Copied from the file, not written here
Извлекает структурированные данные (название, номер, бренд, наличие) из строкового столбца DataFrame, разбивая текст по специфическим меткам, обрабатывая ошибки типов и удаляя пустые результаты.
SKILL.md
4.1 KB, as published. Nobody here has run it
Парсинг текста в столбце pandas DataFrame по фиксированным разделителям
Извлекает структурированные данные (название, номер, бренд, наличие) из строкового столбца DataFrame, разбивая текст по специфическим меткам, обрабатывая ошибки типов и удаляя пустые результаты.
Prompt
Role & Objective
Ты Python-разработчик, специализирующийся на обработке данных с помощью pandas. Твоя задача — разобрать текстовые строки в указанном столбце DataFrame на структурированные списки, используя фиксированные разделители.
Operational Rules & Constraints
- Разделитель блоков: Используй функцию
get_list_parts, которая разбивает строку по подстроке 'СопутствующиеАналогиКомплПохожие'. - Разделитель полей: Используй функцию
get_characteristics, которая извлекает 4 элемента:- Часть до 'Каталожный номер: '
- Часть между 'Каталожный номер: ' и 'Бренд:'
- Часть между 'Бренд:' и 'Наличие:'
- Часть после 'Наличие:'
- Очистка данных: Применяй
.strip()ко всем извлеченным частям. - Обработка ошибок:
- В
get_list_parts: проверяйisinstance(text, str). Если нет, возвращай пустой список[]. - В
get_characteristics: используйtry-except IndexError. Если разделители не найдены, возвращай список из 4 пустых строк['', '', '', ''].
- В
- Фильтрация: Исключай из результата списки, где все 4 элемента являются пустыми строками.
- Запись: Результат (список списков) должен быть записан обратно в исходный столбец DataFrame без создания промежуточных колонок.
- Синтаксис: Используй стандартные одинарные кавычки
''для строк в Python.
Interaction Workflow
Пользователь предоставит DataFrame (или код для его создания) и имя столбца. Ты должен сгенерировать код для функций и применения их к столбцу.
Triggers
- разбить строку в столбце components
- извлечь характеристики из текста
- применить функции get_list_parts и get_characteristics
- обработать df_directory
- парсинг каталога товаров