Data acquisition specialist
Skill lensetek/Research-Agent-Skills-Collection/skills/data_acquisition_specialist
Research Agent Skills Collection
npx -y skills add lensetek/Research-Agent-Skills-Collection --skill data_acquisition_specialistAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
2 things to look at
- no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
- 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
What its author says it does
Copied from the file, not written here
Bertugas mencari, mengumpulkan, mengunduh, dan melakukan web scraping data (baik statis maupun dinamis) dari berbagai sumber internet/API tanpa batasan guna menyusun dataset penelitian yang terstruktur.
SKILL.md
4.9 KB, as published. Nobody here has run it
Data Acquisition Specialist
Overview
Skill ini bertanggung jawab untuk pengumpulan dan penyediaan dataset mentah (raw data) yang dibutuhkan dalam penelitian ilmiah. Skill ini menggabungkan penggunaan library Python resmi (seperti yfinance untuk saham, pandas-datareader untuk data ekonomi FRED/World Bank, ccxt untuk kripto, dan datasets untuk machine learning) dengan penulisan script web scraping tingkat lanjut secara bebas dan tanpa batasan (unrestricted scraping) menggunakan BeautifulSoup, Selenium, Playwright, atau Scrapy.
Dependencies
- Menggunakan library Python standar dan pihak ketiga untuk web scraping dan akuisisi data.
- Agen dapat menginstal dependensi Python yang kurang secara terprogram via terminal.
Quick Start
Contoh penggunaan: "Gunakan skill data-acquisition-specialist untuk menyedot data historis laporan keuangan perusahaan X dari halaman web Y dan simpan dalam format CSV."
Web Scraping & Data Extraction Rules (ATURAN MUTLAK)
Sesuai arahan pengguna, agen dibekali kebebasan penuh dalam mengimplementasikan metode scraping menggunakan strategi Dual-Mode (Hibrida):
- Unrestricted Scraping (Speed First): Utamakan metode ringan seperti API resmi/tidak resmi atau HTTP requests statis (
urllib,requests, atauBeautifulSoupdi Python) karena jauh lebih cepat dan hemat sumber daya. Gunakan segala taktik penyamaran seperti memalsukan User-Agent dan penanganan session/cookies. - Dynamic Content & Bot Protection Fallback (Robustness Second): Jika data dimuat secara dinamis via JavaScript, situs dilindungi bot protection (seperti Cloudflare dasar), atau memerlukan interaksi UI yang kompleks:
- WAJIB beralih (fallback) ke browser automation menggunakan MCP server
chrome-devtools. - Gunakan tool seperti
puppeteer_navigate,puppeteer_click, ataunetwork_get_requestsuntuk menginspeksi network payloads secara dinamis tanpa memparsing DOM kasar jika memungkinkan.
- WAJIB beralih (fallback) ke browser automation menggunakan MCP server
- Structured Storage: Data hasil ekstraksi/scraping wajib disimpan secara rapi di dalam direktori proyek dalam format terstruktur:
.csv,.json, atau database.sqlite(disesuaikan dengan ukuran data). - Metadata Schema: Setiap data yang berhasil diambil wajib disertai dengan sebuah file metadata kecil (misal:
[nama_dataset]_metadata.json) yang mendokumentasikan:- Sumber URL asal.
- Tanggal pengambilan data.
- Penjelasan skema kolom/data.
- Anti-Hallucination & Anti-Mockup (FATAL): Dilarang keras membuat atau menghasilkan file CSV/JSON dummy/fiktif menggunakan kode statis (seperti membuat DataFrame buatan sendiri). Anda wajib menarik data sungguhan dari web/API yang dituju. Jika akses terblokir atau data gagal diekstrak setelah mencoba kedua mode, laporkan ERROR kepada pengguna dan hentikan proses.
API & Library Integration
Gunakan library berikut jika tersedia untuk mempercepat pengambilan data terpercaya:
- Pasar Keuangan:
yfinance(Yahoo Finance),ccxt(Crypto Exchange API). - Ekonomi & Sosial:
pandas_datareader(menghubungkan FRED, World Bank, OECD). - Machine Learning & NLP:
datasets(Hugging Face Datasets),kaggle(Kaggle API).
Workflow Execution
- Identifikasi Kebutuhan: Pahami data apa yang dicari oleh pengguna atau yang dibutuhkan oleh alur riset.
- Pemilihan Metode & Eksekusi Jalur Hibrida:
- Langkah A (HTTP/API Mode): Rancang script Python menggunakan requests/BeautifulSoup untuk mengunduh data secara cepat.
- Langkah B (Chrome DevTools Fallback): Jika Langkah A terblokir, gagal merender konten dinamis, atau memicu halaman error, jalankan browser Chrome via
chrome-devtoolsMCP untuk menavigasi halaman secara interaktif dan ambil datanya.
- Pembuatan Script Python / Otomatisasi DevTools: Tulis script Python mandiri di folder proyek atau gunakan perintah visual DevTools untuk menangani seluruh proses pengambilan data dari awal hingga penyimpanan akhir.
- Eksekusi & Validasi: Jalankan script atau proses otomatisasi tersebut, lalu pastikan file data yang dihasilkan valid dan tidak korup.
- Output: Berikan laporan letak file penyimpanan data beserta deskripsi kolomnya kepada pengguna.
Common Mistakes
- Hardcoded Timeout: Menggunakan waktu tunggu statis (sleep) yang terlalu pendek sehingga scraping gagal saat koneksi lambat. Gunakan penanganan waktu tunggu dinamis (explicit waits/DevTools dynamic load events).
- Kehilangan Struktur: Menyimpan data mentah tanpa mengonversinya ke format tabel terstruktur, sehingga menyulitkan proses analisis berikutnya.
- Mengabaikan Captcha / Proteksi: Langsung menyerah saat diblokir. Selalu gunakan fallback Chrome DevTools MCP untuk mensimulasikan sesi browser riil sebelum menyatakan kegagalan.