Gemini总结 [论文.pdf](/assets/papers/医学同义词模型/SapBERT 1/SapBERT.pdf)
Conclusion
SapBERT 是一套训练方案, 主要的解决的问题是如何找出 更难的负样本
主要的创新点
- Online hard pairs mining
- MS loss function
具体的实现步骤见[SapBERT具体实现步骤](/en/original-notes/papers/CNBEN/SapBERT 1/Actual_process_SapEBRT)
可复用的方法和经验
- Online hard pairs mining, 用于挖掘难负样本
- Data preprocess, 数据预处理,将正样本分组输入保证每一个batch 里面有大量正样本
- fine-tune: 将SapBERT作为进一步预训练方案 对已有的模型进行训练
Problems:
- 输入的数据仍然没有context, 没有办法区别多义词(一个词在不同的上下文有不同的意思)
- 依旧没有sentence-level representation