Sentence Similarity
sentence-transformers
Safetensors
roberta
feature-extraction
Generated from Trainer
dataset_size:35108
loss:CosineSimilarityLoss
Eval Results (legacy)
text-embeddings-inference
Instructions to use eric0009/klue-roberta-base-klue-sts with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use eric0009/klue-roberta-base-klue-sts with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("eric0009/klue-roberta-base-klue-sts") sentences = [ "트럼프의 지지율이 하락했다고 말한 매체는?", "능은 개성에 위치한 현릉(顯陵)이다. 신혜왕후와 함께 합장되었다.\n\n=== 비판 === \n\n재위 기간 중의 정치적 역량은 매우 뛰어났지만, 집권 기간 동안 호족 세력 통제에 완전하지 못했고, 후계 구도를 제대로 잡지 못해 그의 사후 고려 초기의 정치 혼란상을 초래했다는 비판을 받고 있다. \n2대 혜종의 권력 기반을 제대로 만들어주지 못해 그의 사후 정종의 쿠데타와 광종의 대량 숙청이 일어나 고려 초기 사회가 혼란해진 원인을 제공했다. 물론, 그도 생전에 여러 호족 통제 정책들을 시행해 상당한 효과를 보았고, 또 주요 왕자들을 전쟁터로 늘 데려가 왕자들의 군사적 세력을 키워줘 결국 신검을 비롯한 왕자들의 난으로 권력을 잃은 견훤과 달리, 왕건은 장남인 왕무만을 전쟁터에 늘 데리고 가 공을 세우게 해 주고, 이에 반해 다른 왕자들은 외면해서 다른 왕자들이 군사적으로 세력을 키우는 것을 막았으며, 또 자신의 사후 후계 문제를 우려해 박술희와 왕규,염상,박수문 등을 혜종의 후견인으로 삼았으며, 후삼국 통일 과정에서 보여준 혜종의 뛰어난 군사적 능력을 믿고 그에게 보위를 넘겨 주었고, 또 혜종이 보위에 오르기 전에 혜종과 정종의 아내들을 서로 자매들로 혼인시켜 둘의 싸움을 만류하는 정치적 배려까지 썼지만 더 치밀하지 못해 그의 사후 고려는 한동안 반란과 숙청으로 혼란해졌다.", "남아프리카공화국 국제관계협력부(DIRCO)는 함메를의 위치를 파악하는 데에 초점을 맞춰 리비아에서의 미션을 재개했다. 남아공과 오스트리아 정부는 리비아와의 갈등에 있어 양국 모두가 외교적인 노력이 필요하다는 것을 알고, 그의 시신을 인도 받고 제대로 된 장례를 치르기 위해 서로 협력하기 시작했다. \n\n2011년 12월 6일 국제관계협력부 야당의 장관은, 그의 실종기간에 그의 신변의 안전 보장에 대한 확인과 적극적인 조치를 취하지 않은 남아공 정부에게 책임을 물었다. 국제관계협력부는 내전으로 인해 상황이 어려웠다고 말했다 페니 수크라지는 비영리단체를 구성하여 그의 실종에 관한 소식을 확산시킬 수 있었다\n\n국제기자연맹의 회장은 \"사실을 은폐하려고 한 리비아 정부에 의해 살해당한 충격적인 그의 사망 뉴스를 어떻게 감당할 수 있을지 모르겠다. 우리는 그의 부인 페니 수크라지에게 진심으로 애도의 말씀을 올린다.\"라고 말했다. 요하네스버그 프레스 클럽의 부회장인 막셀 드 콕은 만약 기자들이 계속해서 리비아 내전의 전투와 국제법 위반 과정을 폭로하는 취재를 진행한다면, 그들은 전쟁과 분쟁지역에서 반드시 보호받아야 한다고 강조했다", "정보기술(IT) 업계 양대 거인인 구글과 페이스북이 시장 지배력을 유지하기 위해 경쟁적으로 기업 인수합병(M&A)에 나서면서 이 업계 M&A 시장이 14년 만에 가장 뜨겁게 달아오르고 있다고 파이낸셜타임스(FT)가 20일(현지시간) 보도했다. 시장조사회사 딜로직에 따르면 지난 19일 페이스북이 모바일 메신저서비스 왓츠앱을 190억달러에 인수한다고 발표하면서 올 들어 현재까지 IT업계에서만 500억달러의 M&A가 성사됐다. 닷컴버블 당시인 2000년 1분기 780억 달러의 M&A가 이뤄진 이후 가장 바쁜 1분기다.IT업계에 이처럼 M&A의 큰 장이 선 이유는 구글과 페이스북이 막대한 현금 동원 능력과 급등한 주가를 앞세워 잠재적 라이벌을 빠르게 사들이고 있기 때문이다. 페이스북은 2012년 10억달러를 주고 사진공유 소셜네트워크서비스(SNS) 인스타그램을 인수했다. 지난해 말에는 일정 시간이 지나면 공유한 사진이 상대방 스마트폰에서 사라지는 메신저 서비스 스냅챗을 30억달러에 인수하려다 거절당하기도 했다. FT는 페이스북이 왓츠앱 인수에 190억달러라는 천문학적 돈을 쓴 것은 M&A에 대한 절박한 심정을 반영한다고 분석했다. 구글은 이미 세계에서 M&A를 가장 많이 하는 기업이 됐다. 최근 블룸버그 조사 결과 구글은 2011년부터 지난달까지 3년간 총 127개 회사를 사들였다. 광고회사 WPP와 반도체회사 인텔을 누르고 M&A 건수 1위를 기록했다. 최근에는 스마트 온도조절장치 제조사인 네스트랩을 32억달러에 인수했으며 작년 12월에는 로봇사업 진출을 위해 보스턴 다이내믹스를 사들였다. CCS인사이트의 IT 애널리스트인 제프 블레이버는 “마치 라스베이거스의 도박사들이 판돈 제한 없는 포커 테이블에 앉아 끊임없이 판돈을 올리는 것 같다”며 과열된 분위기를 우려했다. 반면 사람들에게 쉽게 잊혀지는 IT 업계에서 관심을 유지하기 위해서는 공격적인 M&A가 불가피하다는 의견도 있다. 레트 월래스 트리톤리서치 최고경영자(CEO)는 “한번 청중을 잃으면 파티는 끝난다”고 말했다." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
Upload folder using huggingface_hub
Browse files- README.md +54 -55
- eval/similarity_evaluation_results.csv +4 -4
- model.safetensors +1 -1
README.md
CHANGED
|
@@ -4,35 +4,35 @@ tags:
|
|
| 4 |
- sentence-similarity
|
| 5 |
- feature-extraction
|
| 6 |
- generated_from_trainer
|
| 7 |
-
- dataset_size:
|
| 8 |
- loss:CosineSimilarityLoss
|
| 9 |
base_model: klue/roberta-base
|
| 10 |
widget:
|
| 11 |
-
- source_sentence:
|
| 12 |
sentences:
|
| 13 |
-
-
|
| 14 |
-
-
|
| 15 |
-
-
|
| 16 |
-
- source_sentence:
|
| 17 |
sentences:
|
| 18 |
-
-
|
| 19 |
-
-
|
| 20 |
-
-
|
| 21 |
-
- source_sentence:
|
| 22 |
sentences:
|
| 23 |
-
-
|
| 24 |
-
-
|
| 25 |
-
-
|
| 26 |
-
- source_sentence:
|
| 27 |
sentences:
|
| 28 |
-
-
|
| 29 |
-
-
|
| 30 |
-
-
|
| 31 |
-
- source_sentence:
|
| 32 |
sentences:
|
| 33 |
-
-
|
| 34 |
-
-
|
| 35 |
-
-
|
| 36 |
pipeline_tag: sentence-similarity
|
| 37 |
library_name: sentence-transformers
|
| 38 |
metrics:
|
|
@@ -49,16 +49,16 @@ model-index:
|
|
| 49 |
type: unknown
|
| 50 |
metrics:
|
| 51 |
- type: pearson_cosine
|
| 52 |
-
value: 0.
|
| 53 |
name: Pearson Cosine
|
| 54 |
- type: spearman_cosine
|
| 55 |
-
value: 0.
|
| 56 |
name: Spearman Cosine
|
| 57 |
- type: pearson_cosine
|
| 58 |
-
value: 0.
|
| 59 |
name: Pearson Cosine
|
| 60 |
- type: spearman_cosine
|
| 61 |
-
value: 0.
|
| 62 |
name: Spearman Cosine
|
| 63 |
---
|
| 64 |
|
|
@@ -111,9 +111,9 @@ from sentence_transformers import SentenceTransformer
|
|
| 111 |
model = SentenceTransformer("sentence_transformers_model_id")
|
| 112 |
# Run inference
|
| 113 |
sentences = [
|
| 114 |
-
'
|
| 115 |
-
'
|
| 116 |
-
'
|
| 117 |
]
|
| 118 |
embeddings = model.encode(sentences)
|
| 119 |
print(embeddings.shape)
|
|
@@ -122,9 +122,9 @@ print(embeddings.shape)
|
|
| 122 |
# Get the similarity scores for the embeddings
|
| 123 |
similarities = model.similarity(embeddings, embeddings)
|
| 124 |
print(similarities)
|
| 125 |
-
# tensor([[
|
| 126 |
-
# [
|
| 127 |
-
# [
|
| 128 |
```
|
| 129 |
<!--
|
| 130 |
### Direct Usage (Transformers)
|
|
@@ -160,8 +160,8 @@ You can finetune this model on your own dataset.
|
|
| 160 |
|
| 161 |
| Metric | Value |
|
| 162 |
|:--------------------|:-----------|
|
| 163 |
-
| pearson_cosine | 0.
|
| 164 |
-
| **spearman_cosine** | **0.
|
| 165 |
|
| 166 |
#### Semantic Similarity
|
| 167 |
|
|
@@ -169,8 +169,8 @@ You can finetune this model on your own dataset.
|
|
| 169 |
|
| 170 |
| Metric | Value |
|
| 171 |
|:--------------------|:-----------|
|
| 172 |
-
| pearson_cosine | 0.
|
| 173 |
-
| **spearman_cosine** | **0.
|
| 174 |
|
| 175 |
<!--
|
| 176 |
## Bias, Risks and Limitations
|
|
@@ -190,19 +190,19 @@ You can finetune this model on your own dataset.
|
|
| 190 |
|
| 191 |
#### Unnamed Dataset
|
| 192 |
|
| 193 |
-
* Size:
|
| 194 |
* Columns: <code>sentence_0</code>, <code>sentence_1</code>, and <code>label</code>
|
| 195 |
* Approximate statistics based on the first 1000 samples:
|
| 196 |
-
| | sentence_0
|
| 197 |
-
|:--------|:---------------------------------------------------------------------------------
|
| 198 |
-
| type | string
|
| 199 |
-
| details | <ul><li>min:
|
| 200 |
* Samples:
|
| 201 |
-
| sentence_0
|
| 202 |
-
|:---------------------------------------------------
|
| 203 |
-
| <code>
|
| 204 |
-
| <code>
|
| 205 |
-
| <code>
|
| 206 |
* Loss: [<code>CosineSimilarityLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#cosinesimilarityloss) with these parameters:
|
| 207 |
```json
|
| 208 |
{
|
|
@@ -326,19 +326,18 @@ You can finetune this model on your own dataset.
|
|
| 326 |
### Training Logs
|
| 327 |
| Epoch | Step | Training Loss | spearman_cosine |
|
| 328 |
|:------:|:----:|:-------------:|:---------------:|
|
| 329 |
-
| -1 | -1 | - | 0.
|
| 330 |
-
| 0.
|
| 331 |
-
| 1.0 |
|
| 332 |
-
| 1.
|
| 333 |
-
| 2.0 |
|
| 334 |
-
| 2.
|
| 335 |
-
| 3.0 |
|
| 336 |
-
| 3.
|
| 337 |
-
| 4.0 | 2364 | - | 0.9183 |
|
| 338 |
|
| 339 |
|
| 340 |
### Training Time
|
| 341 |
-
- **Training**:
|
| 342 |
|
| 343 |
### Framework Versions
|
| 344 |
- Python: 3.12.13
|
|
|
|
| 4 |
- sentence-similarity
|
| 5 |
- feature-extraction
|
| 6 |
- generated_from_trainer
|
| 7 |
+
- dataset_size:10501
|
| 8 |
- loss:CosineSimilarityLoss
|
| 9 |
base_model: klue/roberta-base
|
| 10 |
widget:
|
| 11 |
+
- source_sentence: 제가몰랐던 것은 개인실이기 때문에 같은 층에 다른 게스트가 있고 부엌은 그 게스트와 같이 공유하는 것입니다.
|
| 12 |
sentences:
|
| 13 |
+
- 개인 방이라서 몰랐는데, 같은 층에 다른 손님이 계셔서 부엌을 손님과 같이 쓰게 되었어요.
|
| 14 |
+
- 뉴욕과 함께 저지 시티의 매력을 느낄 수 있는 최적의 장소라고 생각합니다.
|
| 15 |
+
- 인테리어, 공간 크기, 청결도가 가장 좋았습니다.
|
| 16 |
+
- source_sentence: 어제 입은 비옷의 색깔을 알려주십시오.
|
| 17 |
sentences:
|
| 18 |
+
- 정말 훌륭한 전망이 펼쳐지는 집이더군요.
|
| 19 |
+
- 우선, 꽃잎, 페퍼민트 사탕, 그리고 화려한 휴가와 같은 대표적인 상업 영화들은 항상 감동적입니다.
|
| 20 |
+
- 알려줘. 어제 입은 비옷 색깔.
|
| 21 |
+
- source_sentence: 좋은 위치 좋은 호스트 귀여운 고양이 그리고 맛있는 음식점 근처에 많고 모든 것이 좋은 숙소
|
| 22 |
sentences:
|
| 23 |
+
- 11월에는 대전시 유성구청 인력 120명을 대상으로 반려식물을 제공할 계획이다.
|
| 24 |
+
- 좋은 위치는 귀여운 고양이와 맛있는 레스토랑 근처에 있는 많은 좋은 숙박시설입니다.
|
| 25 |
+
- 결제 메일이 다른 메일에 섞이지 않도록 즐겨찾기로 지정해주세요.
|
| 26 |
+
- source_sentence: 문제가 생길 때마다 빠른 답변과 문제해결을 도왔습니다.
|
| 27 |
sentences:
|
| 28 |
+
- 문제가 생길 때마다, 저는 빠른 대답을 했고 문제를 해결하도록 도왔습니다.
|
| 29 |
+
- 두번째로 에어비앤비 이용하는데 좋았어요!
|
| 30 |
+
- 코로나바이러스 감염 중앙재난안전대책본부는 22일 정례 브리핑에서 꽃과 친환경 농산물 재배농가에 대한 지원 대책을 설명했습니다.
|
| 31 |
+
- source_sentence: 체크아웃 이후 짐을 맡길 수도 있었어요
|
| 32 |
sentences:
|
| 33 |
+
- 체크아웃 후에 짐을 맡길 수도 있었어요.
|
| 34 |
+
- 다음에 숙소 쓸땐 이런 일이 없었으면 합니다.
|
| 35 |
+
- 2월(예비)부터는 특허 및 실용신안 신청 시 제출해야 하는 사양서 제출 형식이 다양해집니다.
|
| 36 |
pipeline_tag: sentence-similarity
|
| 37 |
library_name: sentence-transformers
|
| 38 |
metrics:
|
|
|
|
| 49 |
type: unknown
|
| 50 |
metrics:
|
| 51 |
- type: pearson_cosine
|
| 52 |
+
value: 0.34770709824935425
|
| 53 |
name: Pearson Cosine
|
| 54 |
- type: spearman_cosine
|
| 55 |
+
value: 0.35560473197486514
|
| 56 |
name: Spearman Cosine
|
| 57 |
- type: pearson_cosine
|
| 58 |
+
value: 0.9608254847656712
|
| 59 |
name: Pearson Cosine
|
| 60 |
- type: spearman_cosine
|
| 61 |
+
value: 0.9202325648278208
|
| 62 |
name: Spearman Cosine
|
| 63 |
---
|
| 64 |
|
|
|
|
| 111 |
model = SentenceTransformer("sentence_transformers_model_id")
|
| 112 |
# Run inference
|
| 113 |
sentences = [
|
| 114 |
+
'체크아웃 이후 짐을 맡길 수도 있었어요',
|
| 115 |
+
'체크아웃 후에 짐을 맡길 수도 있���어요.',
|
| 116 |
+
'다음에 숙소 쓸땐 이런 일이 없었으면 합니다.',
|
| 117 |
]
|
| 118 |
embeddings = model.encode(sentences)
|
| 119 |
print(embeddings.shape)
|
|
|
|
| 122 |
# Get the similarity scores for the embeddings
|
| 123 |
similarities = model.similarity(embeddings, embeddings)
|
| 124 |
print(similarities)
|
| 125 |
+
# tensor([[1.0000, 0.9790, 0.1348],
|
| 126 |
+
# [0.9790, 1.0000, 0.1390],
|
| 127 |
+
# [0.1348, 0.1390, 1.0000]])
|
| 128 |
```
|
| 129 |
<!--
|
| 130 |
### Direct Usage (Transformers)
|
|
|
|
| 160 |
|
| 161 |
| Metric | Value |
|
| 162 |
|:--------------------|:-----------|
|
| 163 |
+
| pearson_cosine | 0.3477 |
|
| 164 |
+
| **spearman_cosine** | **0.3556** |
|
| 165 |
|
| 166 |
#### Semantic Similarity
|
| 167 |
|
|
|
|
| 169 |
|
| 170 |
| Metric | Value |
|
| 171 |
|:--------------------|:-----------|
|
| 172 |
+
| pearson_cosine | 0.9608 |
|
| 173 |
+
| **spearman_cosine** | **0.9202** |
|
| 174 |
|
| 175 |
<!--
|
| 176 |
## Bias, Risks and Limitations
|
|
|
|
| 190 |
|
| 191 |
#### Unnamed Dataset
|
| 192 |
|
| 193 |
+
* Size: 10,501 training samples
|
| 194 |
* Columns: <code>sentence_0</code>, <code>sentence_1</code>, and <code>label</code>
|
| 195 |
* Approximate statistics based on the first 1000 samples:
|
| 196 |
+
| | sentence_0 | sentence_1 | label |
|
| 197 |
+
|:--------|:---------------------------------------------------------------------------------|:---------------------------------------------------------------------------------|:---------------------------------------------------------------|
|
| 198 |
+
| type | string | string | float |
|
| 199 |
+
| details | <ul><li>min: 7 tokens</li><li>mean: 20.3 tokens</li><li>max: 81 tokens</li></ul> | <ul><li>min: 5 tokens</li><li>mean: 19.7 tokens</li><li>max: 65 tokens</li></ul> | <ul><li>min: 0.0</li><li>mean: 0.46</li><li>max: 1.0</li></ul> |
|
| 200 |
* Samples:
|
| 201 |
+
| sentence_0 | sentence_1 | label |
|
| 202 |
+
|:---------------------------------------------------|:----------------------------------------------------|:------------------|
|
| 203 |
+
| <code>집에 조명등 켜지 말고 그냥 꺼둬</code> | <code>당신 잊지말고 집안 조명 끄지말고 밝게 유지하세요.</code> | <code>0.4</code> |
|
| 204 |
+
| <code>한류 문화의 우수성을 또 한 번 세계에 보여준 쾌거입니다.</code> | <code>한류 문화의 우수성을 다시 한번 세계에 알리는 것은 큰 성과입니다.</code> | <code>0.74</code> |
|
| 205 |
+
| <code>취사나 세탁기사용은 안되지만 아침식사를 할 수 있는 쿠폰을 줍니다.</code> | <code>공용주방은 식재료 보관공간이나 요리할 수 있는 작업대가 충분했습니다.</code> | <code>0.0</code> |
|
| 206 |
* Loss: [<code>CosineSimilarityLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#cosinesimilarityloss) with these parameters:
|
| 207 |
```json
|
| 208 |
{
|
|
|
|
| 326 |
### Training Logs
|
| 327 |
| Epoch | Step | Training Loss | spearman_cosine |
|
| 328 |
|:------:|:----:|:-------------:|:---------------:|
|
| 329 |
+
| -1 | -1 | - | 0.3556 |
|
| 330 |
+
| 0.7610 | 500 | 0.0268 | - |
|
| 331 |
+
| 1.0 | 657 | - | 0.9043 |
|
| 332 |
+
| 1.5221 | 1000 | 0.0080 | 0.9124 |
|
| 333 |
+
| 2.0 | 1314 | - | 0.9160 |
|
| 334 |
+
| 2.2831 | 1500 | 0.0050 | - |
|
| 335 |
+
| 3.0 | 1971 | - | 0.9198 |
|
| 336 |
+
| 3.0441 | 2000 | 0.0034 | 0.9202 |
|
|
|
|
| 337 |
|
| 338 |
|
| 339 |
### Training Time
|
| 340 |
+
- **Training**: 2.9 minutes
|
| 341 |
|
| 342 |
### Framework Versions
|
| 343 |
- Python: 3.12.13
|
eval/similarity_evaluation_results.csv
CHANGED
|
@@ -1,5 +1,5 @@
|
|
| 1 |
epoch,steps,cosine_pearson,cosine_spearman
|
| 2 |
-
1.0,
|
| 3 |
-
2.0,
|
| 4 |
-
3.0,
|
| 5 |
-
4.0,
|
|
|
|
| 1 |
epoch,steps,cosine_pearson,cosine_spearman
|
| 2 |
+
1.0,657,0.953685694408013,0.9043437650117438
|
| 3 |
+
2.0,1314,0.9591367086424393,0.9159684808824391
|
| 4 |
+
3.0,1971,0.9606652076165402,0.9198357707357137
|
| 5 |
+
4.0,2628,0.9608120050081257,0.9193565351137655
|
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 442494792
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:a5367fd6fefa4c74cdba929113b271c77f87fc2d5d4a85449a9a4192ab97a986
|
| 3 |
size 442494792
|