sergeyzh commited on
Commit
762e3dd
·
verified ·
1 Parent(s): 009667f

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +5 -3
README.md CHANGED
@@ -18,9 +18,9 @@ license: mit
18
 
19
  ---
20
 
21
- ## Быстрый Bert для Semantic text similarity (STS)
22
 
23
- Быстрая модель BERT для расчетов компактных эмбедингов предложений на русском языке. Модель основана на [cointegrated/rubert-tiny2](https://huggingface.co/cointegrated/rubert-tiny2) - имеет аналогичный размеры контекста (2048), ембединга (312) и быстродействие.
24
 
25
  На STS и близких задачах (PI, NLI, SA, TI) для русского языка превосходит по качеству LaBSE. Оптимальна для использования в составе RAG LLMs при инференсе на CPU. Для работы с контекстом свыше 512 токенов требует дообучения под целевой домен.
26
 
@@ -63,6 +63,7 @@ print(util.dot_score(embeddings, embeddings))
63
  | Модель | STS | PI | NLI | SA | TI |
64
  |:---------------------------------|:---------:|:---------:|:---------:|:---------:|:---------:|
65
  | [intfloat/multilingual-e5-large](https://huggingface.co/intfloat/multilingual-e5-large) | 0.862 | 0.727 | 0.473 | 0.810 | 0.979 |
 
66
  | **sergeyzh/rubert-tiny-sts** | **0.797** | **0.702** | **0.453** | **0.778** | **0.946** |
67
  | [Tochka-AI/ruRoPEBert-e5-base-512](https://huggingface.co/Tochka-AI/ruRoPEBert-e5-base-512) | 0.793 | 0.704 | 0.457 | 0.803 | 0.970 |
68
  | [cointegrated/LaBSE-en-ru](https://huggingface.co/cointegrated/LaBSE-en-ru) | 0.794 | 0.659 | 0.431 | 0.761 | 0.946 |
@@ -79,8 +80,9 @@ print(util.dot_score(embeddings, embeddings))
79
  ## Быстродействие и размеры
80
 
81
  | Модель | CPU | GPU | size | dim | n_ctx | n_vocab |
82
- |:---------------------------------|:---------:|:---------:|:---------:|:---------:|:---------:|:---------:|
83
  | [intfloat/multilingual-e5-large](https://huggingface.co/intfloat/multilingual-e5-large) | 149.026 | 15.629 | 2136 | 1024 | 514 | 250002 |
 
84
  | **sergeyzh/rubert-tiny-sts** | **3.208** | **2.866** | **111** | **312** | **2048** | **83828** |
85
  | [Tochka-AI/ruRoPEBert-e5-base-512](https://huggingface.co/Tochka-AI/ruRoPEBert-e5-base-512) | 43.314 | 9.338 | 530 | 768 | 512 | 69382 |
86
  | [cointegrated/LaBSE-en-ru](https://huggingface.co/cointegrated/LaBSE-en-ru) | 42.867 | 8.549 | 490 | 768 | 512 | 55083 |
 
18
 
19
  ---
20
 
21
+ ## Быстрый Bert для Semantic text similarity (STS) на CPU
22
 
23
+ Быстрая модель BERT для расчетов компактных эмбедингов предложений на русском языке. Модель основана на [cointegrated/rubert-tiny2](https://huggingface.co/cointegrated/rubert-tiny2) - имеет аналогичный размеры контекста (2048), ембединга (312) и быстродействие. Является первой и самой быстрой моделью в серии BERT-sts.
24
 
25
  На STS и близких задачах (PI, NLI, SA, TI) для русского языка превосходит по качеству LaBSE. Оптимальна для использования в составе RAG LLMs при инференсе на CPU. Для работы с контекстом свыше 512 токенов требует дообучения под целевой домен.
26
 
 
63
  | Модель | STS | PI | NLI | SA | TI |
64
  |:---------------------------------|:---------:|:---------:|:---------:|:---------:|:---------:|
65
  | [intfloat/multilingual-e5-large](https://huggingface.co/intfloat/multilingual-e5-large) | 0.862 | 0.727 | 0.473 | 0.810 | 0.979 |
66
+ | [sergeyzh/LaBSE-ru-sts](https://huggingface.co/sergeyzh/LaBSE-ru-sts) | 0.845 | 0.737 | 0.481 | 0.805 | 0.957 |
67
  | **sergeyzh/rubert-tiny-sts** | **0.797** | **0.702** | **0.453** | **0.778** | **0.946** |
68
  | [Tochka-AI/ruRoPEBert-e5-base-512](https://huggingface.co/Tochka-AI/ruRoPEBert-e5-base-512) | 0.793 | 0.704 | 0.457 | 0.803 | 0.970 |
69
  | [cointegrated/LaBSE-en-ru](https://huggingface.co/cointegrated/LaBSE-en-ru) | 0.794 | 0.659 | 0.431 | 0.761 | 0.946 |
 
80
  ## Быстродействие и размеры
81
 
82
  | Модель | CPU | GPU | size | dim | n_ctx | n_vocab |
83
+ |:---------------------------------|----------:|----------:|----------:|----------:|----------:|----------:|
84
  | [intfloat/multilingual-e5-large](https://huggingface.co/intfloat/multilingual-e5-large) | 149.026 | 15.629 | 2136 | 1024 | 514 | 250002 |
85
+ | [sergeyzh/LaBSE-ru-sts](https://huggingface.co/sergeyzh/LaBSE-ru-sts) | 42.835 | 8.561 | 490 | 768 | 512 | 55083 |
86
  | **sergeyzh/rubert-tiny-sts** | **3.208** | **2.866** | **111** | **312** | **2048** | **83828** |
87
  | [Tochka-AI/ruRoPEBert-e5-base-512](https://huggingface.co/Tochka-AI/ruRoPEBert-e5-base-512) | 43.314 | 9.338 | 530 | 768 | 512 | 69382 |
88
  | [cointegrated/LaBSE-en-ru](https://huggingface.co/cointegrated/LaBSE-en-ru) | 42.867 | 8.549 | 490 | 768 | 512 | 55083 |