Model card for clipkd-released-ViT-T-16-baseline-cc12m

ViT-T/16 baseline student trained on CC3M+12M (no KD). ImageNet acc: 30.55%

Model Details

  • Architecture: ViT-T-16
  • Method: CLIP-KD
  • Training Data: CC3M+CC12M
  • ImageNet Top-1: 30.6%
  • Original Repo: https://github.com/winycg/CLIP-KD
  • Paper: CLIP-KD: An Empirical Study of CLIP Model Distillation (CVPR 2024)

Model Usage

import open_clip

model, _, preprocess = open_clip.create_model_and_transforms(
    'hf-hub:fassabilf/clipkd-released-ViT-T-16-baseline-cc12m'
)
tokenizer = open_clip.get_tokenizer('hf-hub:fassabilf/clipkd-released-ViT-T-16-baseline-cc12m')
Downloads last month
9
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support