Skip to main content
Execute qualquer Skill no Manus
com um clique
Repositório GitHub

data-agent-skills

data-agent-skills contém 14 skills coletadas de legout, com cobertura ocupacional por repositório e páginas de detalhe dentro do site.

skills coletadas
14
Stars
0
atualizado
2026-03-11
Forks
0
Cobertura ocupacional
3 categorias ocupacionais · 100% classificado
explorador de repositórios

Skills neste repositório

accessing-cloud-storage
Desenvolvedores de software

Access cloud storage (S3, GCS, Azure) in Python using fsspec, pyarrow.fs, or obstore. Includes DataFrame integrations (Polars, DuckDB, Pandas, PyArrow), performance optimization, patterns for incremental loading, partitioned writes, and cross-cloud copy.

2026-03-11
analyzing-data
Cientistas de dados

Exploratory data analysis and visualization: profiling datasets, choosing appropriate charts, applying statistical tests, and creating effective visualizations for insight communication. Use when understanding data structure, exploring distributions and relationships, selecting visualization libraries, or producing analysis-ready charts.

2026-03-11
assuring-data-pipelines
Desenvolvedores de software

Data quality validation and observability for data pipelines. Combines Great Expectations and Pandera for data validation with OpenTelemetry and Prometheus for monitoring and alerting.

2026-03-11
designing-data-storage
Arquitetos de banco de dados

File formats and lakehouse table formats for data lakes: Parquet, Arrow, Lance, Zarr, Avro, ORC, Delta Lake, Apache Iceberg, and Apache Hudi. Covers compression, partitioning, ACID transactions, schema evolution, and format selection.

2026-03-11
engineering-ai-pipelines
Cientistas de dados

AI/ML production workflows: embedding generation, vector storage, RAG patterns, LLM monitoring, and batch inference.

2026-03-11
engineering-ml-features
Cientistas de dados

Feature engineering for machine learning: encoding categorical variables, scaling numeric features, datetime transformations, text features, and leakage-safe preprocessing pipelines. Use when preparing data for modeling or improving model performance through better representations.

2026-03-11
evaluating-ml-models
Cientistas de dados

Model evaluation and validation: cross-validation strategies, metrics selection, hyperparameter tuning, experiment tracking, and model comparison. Use when assessing model performance, diagnosing issues, selecting models, or optimizing hyperparameters.

2026-03-11
using-flowerpower
Cientistas de dados

Create and manage data pipelines using the FlowerPower framework with Hamilton DAGs and uv. Lightweight orchestration for batch ETL, data transformation, and ML pipelines. Integrates with Delta Lake, DuckDB, Polars, and cloud storage.

2026-03-11
managing-data-catalogs
Arquitetos de banco de dados

Data catalogs for lakehouse architectures: Iceberg catalogs (Hive Metastore, AWS Glue, REST/Tabular), using DuckDB as a lightweight multi-source catalog, and comparisons of open-source metadata tools (Amundsen, DataHub, OpenMetadata).

2026-03-11
orchestrating-data-pipelines
Desenvolvedores de software

Pipeline orchestration and workflow management with Prefect, Dagster, and dbt. Covers scheduling, dependency management, retries, and integration patterns.

2026-03-11
building-data-apps
Desenvolvedores de software

Build interactive web applications for data science and ML: Streamlit, Panel, Gradio, Dash, and NiceGUI. Use for creating stakeholder-facing dashboards, ML model demos, and internal data tools that non-technical users can interact with.

2026-03-11
building-streaming-pipelines
Desenvolvedores de software

Build real-time data pipelines with Apache Kafka, MQTT (IoT), and NATS JetStream. Covers producers, consumers, streaming patterns, and integration with data platforms. Use when designing or implementing streaming data ingestion, event-driven architectures, or real-time processing workflows in Python.

2026-03-11
building-data-pipelines
Desenvolvedores de software

Build production batch data pipelines with Polars, DuckDB, and PyArrow. Covers ETL patterns, medallion architecture, partitioning, and CRUD operations. Use when designing or implementing data ingestion, transformation, and loading workflows in Python.

2026-03-11
working-in-notebooks
Cientistas de dados

Use for Jupyter, JupyterLab, marimo, and Google Colab workflows. Choose this skill when creating, converting, or improving reproducible notebooks for data exploration, analysis, documentation, or teaching.

2026-03-11