원클릭으로
ml-training
Use when training prediction models, extracting metrics, configuring algorithms, or deploying models
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
Use when training prediction models, extracting metrics, configuring algorithms, or deploying models
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
Use when creating, configuring, or running any Dataiku recipe (prepare, join, group, sync, python) including data cleaning, formulas, and GREL
Use when working with data collections, dataset metadata, tags, meanings, or AI-generated descriptions
Use when creating datasets, uploading files, managing schemas, or configuring dataset connections
Use when building datasets, running multi-step pipelines, managing dependencies, or orchestrating recipe execution order
Use when debugging failed jobs, diagnosing errors, or resolving common Dataiku issues
SOC 직업 분류 기준
| name | ml-training |
| description | Use when training prediction models, extracting metrics, configuring algorithms, or deploying models |
Reference patterns for training and deploying ML models via the Dataiku Python API.
# Create ML task
ml_task = project.create_prediction_ml_task(
input_dataset="MY_DATASET",
target_variable="target_column",
prediction_type="BINARY_CLASSIFICATION", # or REGRESSION, MULTICLASS
ml_backend_type="PY_MEMORY",
guess_policy="DEFAULT",
wait_guess_complete=True
)
# Train models (waits for completion)
trained_ids = ml_task.train(session_name="My Training Session")
# Get metrics for each trained model
for model_id in trained_ids:
details = ml_task.get_trained_model_details(model_id)
metrics = details.get_performance_metrics()
algo = details.get_modeling_settings()["algorithm"]
print(f"Model: {algo}")
print(f" AUC: {metrics.get('auc')}")
print(f" Log Loss: {metrics.get('logLoss')}")
Important: Only deploy models when explicitly requested by the user. After training, show results and let the user decide. When deploying, confirm whether to create new or update existing.
result = ml_task.deploy_to_flow(
model_id=best_model_id,
model_name="my_model",
train_dataset="MY_DATASET"
)
# Returns: {"savedModelId": "...", "trainRecipeName": "..."}
saved_model = project.get_saved_model("my_model")
sm_id = saved_model.get_id()
ml_task.redeploy_to_flow(model_id=new_model_id, saved_model_id=sm_id)
analyses = project.list_analyses()
analysis = project.get_analysis(analyses[0]['analysisId'])
ml_tasks_info = analysis.list_ml_tasks()
ml_task = analysis.get_ml_task(ml_tasks_info['mlTasks'][0]['mlTaskId'])
model_ids = ml_task.get_trained_models_ids()