🏗️ Building on HF
Tom Aarsen
AI & ML interests
NLP: text embeddings, information retrieval, named entity recognition, few-shot text classification
Recent Activity
upvoted a collection about 2 hours ago
WeMM-Embedding new activity about 18 hours ago
perplexity-ai/pplx-pii-masking:Add an AutoModel custom code implementation liked a model about 19 hours ago
perplexity-ai/pplx-pii-maskingOrganizations
Training with Prompts
See the Training with Prompts documentation for more details: https://sbert.net/examples/training/prompts/README.html
Reranker Models for MS MARCO
State-of-the-Art NER models - Biomedical domain
State-of-the-Art NER models - Keyphrases
State-of-the-Art NER models - Organizations
-
nbroad/span-marker-roberta-large-orgs-v1
Token Classification • 0.4B • Updated • 7 • 2 -
tomaarsen/span-marker-bert-base-orgs
Token Classification • Updated • 54 • 1 -
nbroad/span-marker-xdistil-l12-h384-orgs-v3
Token Classification • 33.4M • Updated • 7 -
tomaarsen/span-marker-bert-small-orgs
Token Classification • Updated • 10
Strong & Small Rerankers
Trained on MS MARCO using the a similar strategy as https://huggingface.co/cross-encoder/ms-marco-MiniLM-L12-v2, except with the Ettin base models
-
tomaarsen/ms-marco-ettin-150m-reranker
Text Ranking • 0.1B • Updated • 58 • 1 -
tomaarsen/ms-marco-ettin-68m-reranker
Text Ranking • 68.4M • Updated • 675 -
tomaarsen/ms-marco-ettin-32m-reranker
Text Ranking • 32M • Updated • 45.5k -
tomaarsen/ms-marco-ettin-17m-reranker
Text Ranking • 16.9M • Updated • 165
SetFitABSA models
-
tomaarsen/setfit-absa-bge-small-en-v1.5-restaurants-aspect
Text Classification • Updated • 1.17k • 4 -
tomaarsen/setfit-absa-bge-small-en-v1.5-restaurants-polarity
Text Classification • Updated • 1.09k -
tomaarsen/setfit-absa-paraphrase-mpnet-base-v2-restaurants-aspect
Text Classification • 0.1B • Updated • 16 • 1 -
tomaarsen/setfit-absa-paraphrase-mpnet-base-v2-restaurants-polarity
Text Classification • 0.1B • Updated • 13
Reranker Models for GooAQ
https://huggingface.co/blog/train-reranker
-
tomaarsen/reranker-ModernBERT-large-gooaq-bce
Text Ranking • 0.4B • Updated • 1.34k • 9 -
tomaarsen/reranker-NeoBERT-gooaq-bce
Text Ranking • 0.2B • Updated • 14 • 2 -
tomaarsen/reranker-ModernBERT-base-gooaq-bce
Text Ranking • 0.1B • Updated • 425 • 3 -
tomaarsen/reranker-MiniLM-L12-gooaq-bce
Text Ranking • 33.4M • Updated • 13 • 1
Matryoshka Embedding Models
https://huggingface.co/blog/matryoshka
-
BEE-spoke-data/bert-plus-L8-v1.0-syntheticSTS-4k
Sentence Similarity • 88.1M • Updated • 88 • 5 -
aspire/acge_text_embedding
Sentence Similarity • 0.3B • Updated • 505 • 150 -
dunzhang/stella-mrl-large-zh-v3.5-1792d
Sentence Similarity • 0.3B • Updated • 156k • • 50 -
NeuML/pubmedbert-base-embeddings-matryoshka
Sentence Similarity • 0.1B • Updated • 1.83k • • 23
State-of-the-Art NER models - General purpose
-
tomaarsen/span-marker-bert-base-fewnerd-fine-super
Token Classification • 0.1B • Updated • 1.81k • 15 -
tomaarsen/span-marker-roberta-large-fewnerd-fine-super
Token Classification • 0.4B • Updated • 28 • 14 -
tomaarsen/span-marker-mbert-base-multinerd
Token Classification • 0.2B • Updated • 97.2k • 72 -
tomaarsen/span-marker-roberta-large-ontonotes5
Token Classification • 0.4B • Updated • 69 • 14
State-of-the-Art NER models - Acronyms
State-of-the-Art NER models - Tagalog
SpanMarker NER Models
SpanMarker NER models for various domains
SetFit models
Qwen3 Rerankers converted to Sequence Classification
Reranker Models for GooAQ
https://huggingface.co/blog/train-reranker
-
tomaarsen/reranker-ModernBERT-large-gooaq-bce
Text Ranking • 0.4B • Updated • 1.34k • 9 -
tomaarsen/reranker-NeoBERT-gooaq-bce
Text Ranking • 0.2B • Updated • 14 • 2 -
tomaarsen/reranker-ModernBERT-base-gooaq-bce
Text Ranking • 0.1B • Updated • 425 • 3 -
tomaarsen/reranker-MiniLM-L12-gooaq-bce
Text Ranking • 33.4M • Updated • 13 • 1
Training with Prompts
See the Training with Prompts documentation for more details: https://sbert.net/examples/training/prompts/README.html
Matryoshka Embedding Models
https://huggingface.co/blog/matryoshka
-
BEE-spoke-data/bert-plus-L8-v1.0-syntheticSTS-4k
Sentence Similarity • 88.1M • Updated • 88 • 5 -
aspire/acge_text_embedding
Sentence Similarity • 0.3B • Updated • 505 • 150 -
dunzhang/stella-mrl-large-zh-v3.5-1792d
Sentence Similarity • 0.3B • Updated • 156k • • 50 -
NeuML/pubmedbert-base-embeddings-matryoshka
Sentence Similarity • 0.1B • Updated • 1.83k • • 23
Reranker Models for MS MARCO
State-of-the-Art NER models - General purpose
-
tomaarsen/span-marker-bert-base-fewnerd-fine-super
Token Classification • 0.1B • Updated • 1.81k • 15 -
tomaarsen/span-marker-roberta-large-fewnerd-fine-super
Token Classification • 0.4B • Updated • 28 • 14 -
tomaarsen/span-marker-mbert-base-multinerd
Token Classification • 0.2B • Updated • 97.2k • 72 -
tomaarsen/span-marker-roberta-large-ontonotes5
Token Classification • 0.4B • Updated • 69 • 14
State-of-the-Art NER models - Biomedical domain
State-of-the-Art NER models - Acronyms
State-of-the-Art NER models - Keyphrases
State-of-the-Art NER models - Tagalog
State-of-the-Art NER models - Organizations
-
nbroad/span-marker-roberta-large-orgs-v1
Token Classification • 0.4B • Updated • 7 • 2 -
tomaarsen/span-marker-bert-base-orgs
Token Classification • Updated • 54 • 1 -
nbroad/span-marker-xdistil-l12-h384-orgs-v3
Token Classification • 33.4M • Updated • 7 -
tomaarsen/span-marker-bert-small-orgs
Token Classification • Updated • 10
SpanMarker NER Models
SpanMarker NER models for various domains
Strong & Small Rerankers
Trained on MS MARCO using the a similar strategy as https://huggingface.co/cross-encoder/ms-marco-MiniLM-L12-v2, except with the Ettin base models
-
tomaarsen/ms-marco-ettin-150m-reranker
Text Ranking • 0.1B • Updated • 58 • 1 -
tomaarsen/ms-marco-ettin-68m-reranker
Text Ranking • 68.4M • Updated • 675 -
tomaarsen/ms-marco-ettin-32m-reranker
Text Ranking • 32M • Updated • 45.5k -
tomaarsen/ms-marco-ettin-17m-reranker
Text Ranking • 16.9M • Updated • 165
SetFit models
SetFitABSA models
-
tomaarsen/setfit-absa-bge-small-en-v1.5-restaurants-aspect
Text Classification • Updated • 1.17k • 4 -
tomaarsen/setfit-absa-bge-small-en-v1.5-restaurants-polarity
Text Classification • Updated • 1.09k -
tomaarsen/setfit-absa-paraphrase-mpnet-base-v2-restaurants-aspect
Text Classification • 0.1B • Updated • 16 • 1 -
tomaarsen/setfit-absa-paraphrase-mpnet-base-v2-restaurants-polarity
Text Classification • 0.1B • Updated • 13