Update README.md
Browse files
README.md
CHANGED
@@ -18,9 +18,9 @@ license: mit
|
|
18 |
|
19 |
---
|
20 |
|
21 |
-
## Быстрый Bert для Semantic text similarity (STS)
|
22 |
|
23 |
-
Быстрая модель BERT для расчетов компактных эмбедингов предложений на русском языке. Модель основана на [cointegrated/rubert-tiny2](https://huggingface.co/cointegrated/rubert-tiny2) - имеет аналогичный размеры контекста (2048), ембединга (312) и быстродействие.
|
24 |
|
25 |
На STS и близких задачах (PI, NLI, SA, TI) для русского языка превосходит по качеству LaBSE. Оптимальна для использования в составе RAG LLMs при инференсе на CPU. Для работы с контекстом свыше 512 токенов требует дообучения под целевой домен.
|
26 |
|
@@ -63,6 +63,7 @@ print(util.dot_score(embeddings, embeddings))
|
|
63 |
| Модель | STS | PI | NLI | SA | TI |
|
64 |
|:---------------------------------|:---------:|:---------:|:---------:|:---------:|:---------:|
|
65 |
| [intfloat/multilingual-e5-large](https://huggingface.co/intfloat/multilingual-e5-large) | 0.862 | 0.727 | 0.473 | 0.810 | 0.979 |
|
|
|
66 |
| **sergeyzh/rubert-tiny-sts** | **0.797** | **0.702** | **0.453** | **0.778** | **0.946** |
|
67 |
| [Tochka-AI/ruRoPEBert-e5-base-512](https://huggingface.co/Tochka-AI/ruRoPEBert-e5-base-512) | 0.793 | 0.704 | 0.457 | 0.803 | 0.970 |
|
68 |
| [cointegrated/LaBSE-en-ru](https://huggingface.co/cointegrated/LaBSE-en-ru) | 0.794 | 0.659 | 0.431 | 0.761 | 0.946 |
|
@@ -79,8 +80,9 @@ print(util.dot_score(embeddings, embeddings))
|
|
79 |
## Быстродействие и размеры
|
80 |
|
81 |
| Модель | CPU | GPU | size | dim | n_ctx | n_vocab |
|
82 |
-
|
83 |
| [intfloat/multilingual-e5-large](https://huggingface.co/intfloat/multilingual-e5-large) | 149.026 | 15.629 | 2136 | 1024 | 514 | 250002 |
|
|
|
84 |
| **sergeyzh/rubert-tiny-sts** | **3.208** | **2.866** | **111** | **312** | **2048** | **83828** |
|
85 |
| [Tochka-AI/ruRoPEBert-e5-base-512](https://huggingface.co/Tochka-AI/ruRoPEBert-e5-base-512) | 43.314 | 9.338 | 530 | 768 | 512 | 69382 |
|
86 |
| [cointegrated/LaBSE-en-ru](https://huggingface.co/cointegrated/LaBSE-en-ru) | 42.867 | 8.549 | 490 | 768 | 512 | 55083 |
|
|
|
18 |
|
19 |
---
|
20 |
|
21 |
+
## Быстрый Bert для Semantic text similarity (STS) на CPU
|
22 |
|
23 |
+
Быстрая модель BERT для расчетов компактных эмбедингов предложений на русском языке. Модель основана на [cointegrated/rubert-tiny2](https://huggingface.co/cointegrated/rubert-tiny2) - имеет аналогичный размеры контекста (2048), ембединга (312) и быстродействие. Является первой и самой быстрой моделью в серии BERT-sts.
|
24 |
|
25 |
На STS и близких задачах (PI, NLI, SA, TI) для русского языка превосходит по качеству LaBSE. Оптимальна для использования в составе RAG LLMs при инференсе на CPU. Для работы с контекстом свыше 512 токенов требует дообучения под целевой домен.
|
26 |
|
|
|
63 |
| Модель | STS | PI | NLI | SA | TI |
|
64 |
|:---------------------------------|:---------:|:---------:|:---------:|:---------:|:---------:|
|
65 |
| [intfloat/multilingual-e5-large](https://huggingface.co/intfloat/multilingual-e5-large) | 0.862 | 0.727 | 0.473 | 0.810 | 0.979 |
|
66 |
+
| [sergeyzh/LaBSE-ru-sts](https://huggingface.co/sergeyzh/LaBSE-ru-sts) | 0.845 | 0.737 | 0.481 | 0.805 | 0.957 |
|
67 |
| **sergeyzh/rubert-tiny-sts** | **0.797** | **0.702** | **0.453** | **0.778** | **0.946** |
|
68 |
| [Tochka-AI/ruRoPEBert-e5-base-512](https://huggingface.co/Tochka-AI/ruRoPEBert-e5-base-512) | 0.793 | 0.704 | 0.457 | 0.803 | 0.970 |
|
69 |
| [cointegrated/LaBSE-en-ru](https://huggingface.co/cointegrated/LaBSE-en-ru) | 0.794 | 0.659 | 0.431 | 0.761 | 0.946 |
|
|
|
80 |
## Быстродействие и размеры
|
81 |
|
82 |
| Модель | CPU | GPU | size | dim | n_ctx | n_vocab |
|
83 |
+
|:---------------------------------|----------:|----------:|----------:|----------:|----------:|----------:|
|
84 |
| [intfloat/multilingual-e5-large](https://huggingface.co/intfloat/multilingual-e5-large) | 149.026 | 15.629 | 2136 | 1024 | 514 | 250002 |
|
85 |
+
| [sergeyzh/LaBSE-ru-sts](https://huggingface.co/sergeyzh/LaBSE-ru-sts) | 42.835 | 8.561 | 490 | 768 | 512 | 55083 |
|
86 |
| **sergeyzh/rubert-tiny-sts** | **3.208** | **2.866** | **111** | **312** | **2048** | **83828** |
|
87 |
| [Tochka-AI/ruRoPEBert-e5-base-512](https://huggingface.co/Tochka-AI/ruRoPEBert-e5-base-512) | 43.314 | 9.338 | 530 | 768 | 512 | 69382 |
|
88 |
| [cointegrated/LaBSE-en-ru](https://huggingface.co/cointegrated/LaBSE-en-ru) | 42.867 | 8.549 | 490 | 768 | 512 | 55083 |
|