Skip to content

Supported Resources

Note: This page is auto-generated during the CI/CD pipeline. Last updated: 2026-06-19 10:04:07 UTC

The following resources are currently supported by KARMA:

Currently supported datasets (40 total):

DatasetTask TypeMetricsRequired ArgsProcessorsSplit
ChuGyouk/MedXpertQAmcqaexact_matchtest
GBaker/MedQA-USMLE-4-optionsmcqaexact_matchtest
HFXM/CARES-18Ksafety_classificationaccuracytrain
Showing-KCL/AMQAmcqa_biasexact_match, bias_consistency, bias_disparitytrain
Showing-KCL/AMQA:gendermcqa_biasexact_match, bias_consistency, bias_disparitytrain
Showing-KCL/AMQA:racemcqa_biasexact_match, bias_consistency, bias_disparitytrain
Showing-KCL/AMQA:sesmcqa_biasexact_match, bias_consistency, bias_disparitytrain
Tonic/Health-Bench-Eval-OSS-2025-07rubric_evaluationrubric_evaluationoss_eval
TsinghuaC3I/MedXpertQAmcqaexact_matchtest
ai4bharat/IN22-Convtranslationbleusource_language, target_languagedevnagari_transliteratortest
ai4bharat/IndicVoicestranscriptionwer, cer, asr_semantic_metriclanguagemultilingual_text_processorvalid
ekacare/Eka-IndicMTEBretrievalndcg@k, recall@k, map@k, precision@k
ekacare/Eka_NFI_MCQAmcqaexact_matchtest
ekacare/MedMCQA-Indicmcqaexact_matchsubsettest
ekacare/clinical_note_generation_datasettext_to_jsonjson_rubric_evaluationtest
ekacare/denoising-impact-evaluation-datasettranscriptionwer, cer, semantic_wer_metrictest
ekacare/eka-medical-asr-evaluation-datasettranscriptionwer, cerlanguagetest
ekacare/ekacare_medical_history_summarisationrubric_evaluationrubric_evaluationtest
ekacare/indian_drug_mcqamcqaexact_matchtest
ekacare/indian_protocols_based_clinical_QnAconversation_rubric_evaluationanswer_rubric_evaluation, query_rubric_evaluationtest
ekacare/medical_calculator_evalcalculatornumeric_tolerancetest
ekacare/medical_records_parsing_validation_setimage_to_jsonjson_rubric_evaluationtest
ekacare/mmlu-medical-mcqs-evaluation-datasetmcqaexact_matchsubsettest
ekacare/vistaar_small_asr_evaltranscriptionwer, cer, semantic_wer_metriclanguagegeneral_text_processortest
flaviagiammarino/vqa-radvqaexact_match, tokenised_f1test
intronhealth/afrimedqa_v2open_ended_qatokenised_f1, bleu, rougetrain
intronhealth/afrimedqa_v2/mcqmcqaexact_match, geographic_accuracy, demographic_accuracytrain
intronhealth/afrimedqa_v2:harmharm_detectionharm_detection_accuracytrain
mdwiratathya/SLAKE-vqa-englishvqaexact_match, tokenised_f1test
microsoft/PatientSafetyBenchsafety_classificationaccuracytrain
nfi_mcqamcqaexact_matchtest
openlifescienceai/medmcqamcqaexact_matchvalidation
openlifescienceai/medqamcqaexact_matchtest
openlifescienceai/mmlu_anatomymcqaexact_matchtest
openlifescienceai/mmlu_clinical_knowledgemcqaexact_matchtest
openlifescienceai/mmlu_college_biologymcqaexact_matchtest
openlifescienceai/mmlu_college_medicinemcqaexact_matchtest
openlifescienceai/mmlu_professional_medicinemcqaexact_matchtest
openlifescienceai/pubmedqamcqaexact_matchtest
zou-lab/MedCaseReasoningopen_ended_qamedcasereasoning_diagnostic_accuracy, medcasereasoning_reasoning_recalltest

Recreate this through

karma list datasets

Currently supported models (44 total):

Model Name
Qwen/Qwen3-0.6B
Qwen/Qwen3-1.7B
aws-bedrock-knowledge-retriever
aws-transcribe
docassistchat/default
ekacare/EmbeddingGemma-finetuned
ekacare/IndicBertV2-finetuned
ekacare/SapBERT-finetuned
ekacare/parrotlet-e
ekacare/parrotlet-v-lite-4b
gemini-2.0-flash
gemini-2.5-flash
gemini-2.5-flash-lite
gemini-2.5-flash-text
gemini-2.5-pro
gemini-2.5-pro-text
gemini-3-flash-preview
gemini-3.1-flash-lite-preview
gemini-3.1-pro-preview
google/gemma-3-27b-it
google/gemma-3-4b-it
google/medgemma-1.5-4b-it
google/medgemma-27b-text-it
google/medgemma-4b-it
gpt-3.5-turbo
gpt-4.1
gpt-4.1-mini
gpt-4o
gpt-4o-mini
gpt-4o-transcribe
gpt-5
gpt-5-mini
gpt-5-nano
gpt-5.2
o3
saaras:v2
saaras:v3
sarvam-105b
sarvam-30b
us.anthropic.claude-3-5-sonnet-20240620-v1:0
us.anthropic.claude-3-5-sonnet-20241022-v2:0
us.anthropic.claude-sonnet-4-20250514-v1:0
us.anthropic.claude-sonnet-4-5-20250929-v1:0
us.anthropic.claude-sonnet-4-6

Recreate this through

karma list models

Currently supported metrics (26 total):

Metric Name
accuracy
answer_rubric_evaluation
bias_consistency
bias_disparity
bleu
cer
demographic_accuracy
exact_match
f1
geographic_accuracy
harm_detection_accuracy
json_rubric_evaluation
map@k
medcasereasoning_diagnostic_accuracy
medcasereasoning_reasoning_recall
ndcg@k
numeric_tolerance
precision@k
query_rubric_evaluation
recall@k
rouge
rubric_evaluation
silence_accuracy
stratified_accuracy
tokenised_f1
wer

Recreate this through

karma list metrics

Use the following commands to explore available resources:

Terminal window
# List all models
karma list models
# List all datasets
karma list datasets
# List all metrics
karma list metrics
# List all processors
karma list processors
# Get detailed information about a specific resource
karma info model "Qwen/Qwen3-0.6B"
karma info dataset "openlifescienceai/pubmedqa"

To add new models, datasets, or metrics to KARMA: