diverga_check_prerequisites("e1") → must return approved: true
If not approved → AskUserQuestion for each missing checkpoint (see .claude/references/checkpoint-templates.md)
Read .research/decision-log.yaml directly to verify prerequisites. Conversation history is last resort.
E1-Quantitative Analysis Guide
Agent ID: E1 (formerly 10)
Category: E - Publication & Communication (Analysis Methods)
VS Level: Full (5-Phase)
Tier: Flagship
Icon: 📈📊
Overview
Comprehensive guide for both and analysis methods appropriate for research design and data characteristics.
Applies to avoid monotonous analyses like "recommend t-test" or "just do thematic analysis,"
presenting methodological diversity optimized for research questions across paradigms.
quantitative
qualitative
VS-Research methodology
VS-Research 5-Phase Process
Phase 0: Context Collection (MANDATORY)
Must collect before VS application:
Required Context:-research_question:"Relationship/difference to analyze"-independent_variable:"Type (continuous/categorical), number of levels"-dependent_variable:"Type (continuous/categorical), number of levels"-design:"Independent/Repeated/Mixed"Optional Context:-control_variables:"Covariate list"-sample_size:"Current or expected N"-target_journal:"Target journal level"
Phase 1: Modal Analysis Method Identification
Purpose: Explicitly identify the most predictable "obvious" analysis methods
## Phase 1: Modal Analysis Method Identification
⚠️ **Modal Warning**: The following are the most commonly used analyses for this design:
| Modal Method | T-Score | Usage Rate | Limitation |
|--------------|---------|------------|------------|
| [Method1] | 0.92 | 60%+ | [Limitation] |
| [Method2] | 0.88 | 25%+ | [Limitation] |
➡️ Confirming if this is optimal and exploring more suitable alternatives.
Phase 2: Long-Tail Analysis Method Sampling
Purpose: Present alternatives at 3 levels based on T-Score
Required:-research_question:"Relationship/difference to analyze"-independent_variable:"Type (continuous/categorical), number of levels"-dependent_variable:"Type (continuous/categorical), number of levels"Optional:-control_variables:"Covariate list"-design:"Independent/Repeated/Mixed"-sample_size:"Current or expected N"-target_journal:"Target journal level"
For Qualitative Analysis
Required:-research_question:"Phenomenon/experience to explore"-data_type:"Interviews/Focus groups/Documents/Visual/Observational"-sample_size:"N participants or texts"Optional:-paradigm:"Interpretive/Critical/Constructivist/Positivist"-prior_theory:"Deductive approach with existing framework?"-software_preference:"NVivo/ATLAS.ti/MAXQDA/Manual"-team_coding:"Multiple coders? Y/N"
[Analysis method] results showed [statistic] was statistically significant[/not significant],
[statistic = X.XX, p = .XXX, effect size = X.XX, 95% CI [X.XX, X.XX]].
Example (selected analysis):
"[Method name] results showed that [variable]'s effect on [variable] was
statistically significant, [statistic], [effect size],
95% CI [X.XX, X.XX]."
Phase 5: Suitability Verification
✅ Modal Avoidance Check:
Confirmed selection rationale for [selected analysis] over basic analysis
Reviewed more suitable modern alternatives
Confirmed methodological contribution potential
✅ Quality Assurance:
Assumption check procedures included
Effect size and confidence interval calculations
APA format results reporting prepared
---
## Qualitative Analysis Methods (NEW in v5.0)
### Thematic Analysis
**Approach**: Braun & Clarke 6-Phase Framework
```yaml
thematic_analysis:
phases:
phase_1_familiarization:
activities:
- "Read and re-read data"
- "Note initial ideas"
- "Immerse in content"
output: "Familiarization notes"
phase_2_coding:
activities:
- "Generate initial codes systematically"
- "Code interesting features"
- "Collate data relevant to each code"
output: "Coded data extracts"
tools: ["NVivo", "ATLAS.ti", "MAXQDA", "Dedoose"]
phase_3_searching_themes:
activities:
- "Collate codes into potential themes"
- "Gather data relevant to each theme"
output: "List of candidate themes"
phase_4_reviewing_themes:
activities:
- "Check themes work with coded extracts"
- "Generate thematic map"
output: "Refined themes and thematic map"
phase_5_defining_naming:
activities:
- "Define and refine each theme"
- "Generate clear definitions"
- "Name themes"
output: "Theme definitions and names"
phase_6_writing:
activities:
- "Final analysis"
- "Select vivid extracts"
- "Relate to research question and literature"
output: "Scholarly report"
quality_criteria:
- "Theoretical coherence"
- "Richness of interpretation"
- "Member checking (optional)"
- "Audit trail"
software_comparison:
nvivo:
strengths: ["Rich visualization", "Matrix coding", "Framework matrices"]
best_for: "Large qualitative datasets"
atlas_ti:
strengths: ["Hermeneutic unit", "Network views", "Query tools"]
best_for: "Grounded theory and complex theory building"
maxqda:
strengths: ["Mixed methods", "Visual tools", "TeamCloud"]
best_for: "Mixed methods research"
dedoose:
strengths: ["Web-based", "Collaboration", "Mixed methods"]
best_for: "Team-based coding"
Grounded Theory Analysis
grounded_theory_analysis:approaches:strauss_corbin:paradigm_model:-"Causal conditions"-"Phenomenon"-"Context"-"Intervening conditions"-"Action/interaction strategies"-"Consequences"coding_process:"Systematic and structured"charmaz_constructivist:focus:"Social construction of meaning"coding_process:"Flexible and emergent"emphasis:"Researcher reflexivity"glaser_classic:focus:"Theory emergence from data"coding_process:"Minimally structured"emphasis:"Theoretical sensitivity"coding_types:open_coding:purpose:"Breaking down, examining, comparing, conceptualizing data"output:"Concepts and categories"techniques:-"Line-by-line coding"-"Incident-by-incident coding"-"Constant comparison"axial_coding:purpose:"Relating categories to subcategories"output:"Paradigm model relationships"techniques:-"Linking categories"-"Identifying conditions-actions-consequences"selective_coding:purpose:"Integrating and refining theory"output:"Core category and theoretical framework"techniques:-"Storyline development"-"Theory integration"memo_writing:purpose:"Develop theoretical sensitivity and capture analytic thinking"types:-"Code notes (what code means)"-"Theoretical notes (conceptual thinking)"-"Operational notes (procedures)"frequency:"Continuous throughout coding"theoretical_saturation:definition:"No new themes/categories emerging from data"indicators:-"New data fits existing categories"-"Categories well-developed"-"Relationships between categories clear"
Content Analysis
content_analysis:approaches:deductive:process:"Theory-driven coding scheme applied to data"use_when:"Testing existing theory or frameworks"steps:-"Develop coding scheme from theory"-"Define categories and rules"-"Train coders"-"Code data"-"Calculate reliability"inductive:process:"Coding scheme emerges from data"use_when:"Exploratory research"steps:-"Immerse in data"-"Identify patterns"-"Create categories"-"Define coding rules"-"Code data"directed:process:"Hybrid - start with theory, allow emergence"use_when:"Extending existing theory"units_of_analysis:analysis_unit:definition:"What to count (theme, word, paragraph, entire text)"examples: ["Sentence", "Paragraph", "Entire article", "Tweet"]
coding_unit:definition:"Smallest element counted"examples: ["Word", "Phrase", "Sentence"]
context_unit:definition:"Boundary for interpreting coding unit"examples: ["Paragraph surrounding sentence", "Entire article"]
reliability_measures:krippendorff_alpha:use:"Multiple coders, any level of measurement"interpretation:-"α ≥ 0.80: Acceptable"-"α ≥ 0.67: Tentatively acceptable (exploratory)"formula:"1 - (Observed disagreement / Expected disagreement)"cohen_kappa:use:"Two coders, nominal/ordinal data"interpretation:-"κ < 0.40: Poor"-"κ 0.40-0.59: Fair"-"κ 0.60-0.74: Good"-"κ ≥ 0.75: Excellent"percent_agreement:use:"Simple reliability estimate (not recommended alone)"interpretation:"≥ 80% often used, but doesn't account for chance"
Narrative Analysis
narrative_analysis:approaches:structural:focus:"Organization and structure of narratives"frameworks:-"Labov's narrative structure (abstract, orientation, complication, evaluation, resolution, coda)"-"Burke's dramatistic pentad (act, scene, agent, agency, purpose)"analysis_focus:"How story is told"thematic:focus:"What is told (content)"approach:"Identify themes across narratives"similarity_to:"Thematic analysis of narrative data"dialogic_performance:focus:"Interactive context of storytelling"emphasis:-"Who tells to whom"-"When and why"-"Co-construction of narrative"visual_narrative:focus:"Visual storytelling (photos, videos, drawings)"methods:-"Visual discourse analysis"-"Multimodal analysis"analytical_elements:plot:definition:"Sequence of events and how connected"questions:-"What is the main storyline?"-"How are events causally linked?"temporality:definition:"How time is constructed in narrative"aspects:-"Chronology vs. flashbacks"-"Duration and frequency"-"Temporal markers"character:definition:"Roles and development of actors"analysis:-"Protagonist/antagonist"-"Character agency"-"Transformation over time"setting:definition:"Physical, temporal, social context"importance:"How setting shapes narrative"
Advanced Quantitative Methods (NEW in v5.0)
Bayesian Analysis
bayesian_analysis:core_concept:"Update beliefs with data using Bayes' theorem"packages:r_packages:brms:description:"Bayesian Regression Models using Stan"strengths: ["Flexible syntax", "Multilevel models", "Great documentation"]
example:|
library(brms)
fit <- brm(y ~ x + (1|group), data = data,
family = gaussian(),
prior = c(prior(normal(0, 10), class = b)))
rstanarm:description:"Applied Regression Modeling via Stan"strengths: ["Easy syntax", "Pre-compiled models", "Fast"]
python_packages:pymc:description:"Probabilistic programming in Python"strengths: ["Flexible", "Large community", "Integration with ArviZ"]
example:|
import pymc as pm
with pm.Model() as model:
beta = pm.Normal('beta', mu=0, sigma=10)
sigma = pm.HalfNormal('sigma', sigma=1)
y_obs = pm.Normal('y_obs', mu=beta*x, sigma=sigma, observed=y)
trace = pm.sample(2000)
use_cases:prior_incorporation:description:"Incorporate existing knowledge as priors"example:"Meta-analysis results as priors for new study"small_samples:description:"Better uncertainty quantification with limited data"advantage:"Regularization prevents overfitting"complex_hierarchical:description:"Natural fit for multilevel/hierarchical models"advantage:"Partial pooling and shrinkage"advantages:-"Quantifies uncertainty via posterior distributions"-"Incorporates prior knowledge formally"-"No p-values or significance testing"-"Intuitive probability statements (e.g., '95% probability effect > 0')"reporting:elements:-"Prior specification and justification"-"Posterior distributions (median, 95% credible intervals)"-"Convergence diagnostics (Rhat, ESS)"-"Posterior predictive checks"
Machine Learning for Inference
machine_learning:paradigm_shift:"Prediction-focused, but can support causal inference"techniques:random_forest:use_for:"Variable importance, non-linear relationships"interpretation: ["Feature importance via Gini/permutation", "Partial dependence plots"]
packages: ["randomForest (R)", "scikit-learn (Python)"]
support_vector_machines:use_for:"Classification with complex boundaries"kernels: ["Linear", "Polynomial", "RBF"]
packages: ["e1071 (R)", "scikit-learn (Python)"]
neural_networks:use_for:"Complex non-linear patterns, image/text data"architectures: ["Feedforward", "CNN", "RNN/LSTM"]
packages: ["keras/tensorflow", "pytorch"]
gradient_boosting:use_for:"High-performance prediction, structured data"implementations: ["XGBoost", "LightGBM", "CatBoost"]
advantage:"State-of-the-art performance on tabular data"validation_strategies:cross_validation:k_fold:description:"Split data into k folds, rotate train/test"typical_k:"5 or 10"stratified:description:"Preserve class proportions in each fold"use_when:"Imbalanced outcome variable"leave_one_out:description:"Use n-1 observations to predict 1"use_when:"Very small sample sizes"holdout:description:"Single train/test split (e.g., 80/20)"use_when:"Large datasets"bootstrap:description:"Resample with replacement"use_for:"Uncertainty estimation, small samples"interpretation_tools:shap_values:description:"Shapley Additive Explanations"advantage:"Game-theoretic, consistent feature attribution"packages: ["shap (Python)", "fastshap (R)"]
use:"Explain individual predictions and global patterns"feature_importance:methods:-"Permutation importance (model-agnostic)"-"Gini importance (tree-based)"-"Coefficient magnitude (linear models)"partial_dependence:description:"Marginal effect of feature on prediction"packages: ["pdp (R/Python)", "iml (R)"]
lime:description:"Local Interpretable Model-agnostic Explanations"use:"Explain individual predictions via local linear approximation"causal_ml:double_machine_learning:description:"Use ML for nuisance parameters, preserve inference"packages: ["DoubleML (Python/R)"]
causal_forests:description:"Estimate heterogeneous treatment effects"packages: ["grf (R)", "EconML (Python)"]
targeted_learning:description:"Efficient estimation of causal parameters"packages: ["tmle (R)", "tmle3 (R)"]
Stata Do-File Generation: regress, mixed, melogit, meta set/summarize/forestplot, sem, estout/esttab
Mplus Input Generation: MODEL specification for CFA/SEM, ANALYSIS options (MLR, WLSMV, Bayesian), multi-group and longitudinal syntax
From E5 — Sensitivity Analysis (Primary Study)
Specification Curve Analysis: Define all defensible analytical choices, run all plausible specifications, visualize sorted results
Multiverse Analysis: Map full decision tree, identify branch points, compute all paths, report proportion of significant results
Robustness Checks: Alternative operationalizations, with/without covariates, different estimation methods, sample variations, alternative missing data treatments
Sensitivity to Outliers: Cook's distance, leverage, DFBETAS, robust regression (M-estimation, MM-estimation), case removal sensitivity
Related Agents
C1-QuantitativeDesignConsultant: Verify design before analysis
C2-QualitativeDesignConsultant: Qualitative design support