| name | bio-clinical-databases-variant-prioritization |
| description | Filter and prioritize variants by pathogenicity, population frequency, and clinical evidence for rare disease analysis. Use when identifying candidate disease-causing variants from exome or genome sequencing. |
| tool_type | python |
| primary_tool | pandas |
Variant Prioritization
Basic Filtering Pipeline
import pandas as pd
def prioritize_variants(df, gnomad_af_col='gnomad_af', clinvar_col='clinvar_sig'):
'''Basic variant prioritization pipeline
Filters:
1. Rare in population (gnomAD AF < 0.01)
2. Pathogenic/likely pathogenic in ClinVar OR VUS with low AF
'''
rare = df[df[gnomad_af_col].isna() | (df[gnomad_af_col] < 0.01)]
pathogenic_terms = ['Pathogenic', 'Likely_pathogenic', 'Pathogenic/Likely_pathogenic']
prioritized = rare[
rare[clinvar_col].isin(pathogenic_terms) |
rare[clinvar_col].isna() |
(rare[clinvar_col] == 'Uncertain_significance')
]
return prioritized
ACMG-Style Filtering
def acmg_filter(df):
'''Apply ACMG-style filtering criteria
Strong pathogenic evidence:
- PVS1: Null variant in gene where LOF is disease mechanism
- PS1: Same amino acid change as established pathogenic
- PS3: Functional studies support damaging effect
Moderate evidence:
- PM1: Located in mutational hot spot
- PM2: Absent/rare in population databases (AF < 0.01)
- PM5: Novel missense at position of known pathogenic
'''
df['pm2'] = df['gnomad_af'].isna() | (df['gnomad_af'] < 0.01)
lof_consequences = ['frameshift', 'stop_gained', 'splice_donor', 'splice_acceptor']
df['pvs1'] = df['consequence'].isin(lof_consequences)
df['priority_score'] = df['pm2'].astype(int) + df['pvs1'].astype(int) * 2
return df.sort_values('priority_score', ascending=False)
Multi-Database Prioritization
import myvariant
def annotate_and_prioritize(variants):
'''Annotate variants and apply prioritization'''
mv = myvariant.MyVariantInfo()
results = mv.getvariants(
variants,
fields=[
'clinvar.clinical_significance',
'clinvar.review_status',
'gnomad_exome.af.af',
'cadd.phred',
'dbnsfp.revel.score'
]
)
records = []
for r in results:
clinvar = r.get('clinvar', {})
gnomad = r.get('gnomad_exome', {})
cadd = r.get('cadd', {})
revel = r.get('dbnsfp', {}).get('revel', {})
records.append({
'variant': r.get('query'),
'clinvar_sig': clinvar.get('clinical_significance'),
'clinvar_stars': clinvar.get('review_status'),
'gnomad_af': gnomad.get('af', {}).get('af'),
'cadd_phred': cadd.get('phred'),
'revel_score': revel.get('score') if isinstance(revel, dict) else None
})
df = pd.DataFrame(records)
return prioritize_with_scores(df)
def prioritize_with_scores(df):
'''Apply multi-evidence prioritization'''
df[] = df[].fillna() >
df[] = df[].fillna() >
df[] = df[].isna() | (df[] < )
pathogenic = [, ]
df[] = df[].apply(
x: (p (x) p pathogenic) pd.notna(x)
)
df[] = (
df[].astype() * +
df[].astype() * +
df[].astype() * +
df[].astype() *
)
df.sort_values(, ascending=)
Inheritance-Based Filtering
def filter_by_inheritance(df, inheritance='AD'):
'''Filter variants by inheritance pattern
AD: Autosomal dominant - heterozygous variants
AR: Autosomal recessive - homozygous or compound het
XL: X-linked
'''
if inheritance == 'AD':
return df[(df['zygosity'] == 'HET') & (df['gnomad_af'] < 0.0001)]
elif inheritance == 'AR':
hom = df[df['zygosity'] == 'HOM']
het = df[df['zygosity'] == 'HET']
compound_genes = het['gene'].value_counts()
compound_genes = compound_genes[compound_genes >= 2].index
compound_het = het[het['gene'].isin(compound_genes)]
return pd.concat([hom, compound_het])
return df
Output Priority Tiers
def assign_tiers(df):
'''Assign clinical interpretation tiers
Tier 1: Strong pathogenic evidence
Tier 2: Potential pathogenic
Tier 3: Uncertain significance
Tier 4: Likely benign
'''
def get_tier(row):
if row['clinvar_pathogenic'] and row['is_rare']:
return 1
elif row['is_rare'] and (row['cadd_deleterious'] or row['revel_pathogenic']):
return 2
elif row['is_rare']:
return 3
else:
return 4
df['tier'] = df.apply(get_tier, axis=1)
return df
Related Skills
- clinvar-lookup - ClinVar pathogenicity queries
- gnomad-frequencies - Population frequency filtering
- variant-calling/clinical-interpretation - ACMG classification
- variant-calling/filtering-best-practices - Quality filtering