今天我想跟大家分享一下禾蛙和Domi最重要的一个能力,就是匹配能力。无论是岗位与人选的匹配,还是猎头与猎头之间的匹配,都对我们的业务很重要。
其实智能匹配技术出来很多年了,最早匹配技术是基于用户行为的推荐系统和基于关键词的搜索系统组合而成。但是这种技术,只能解决一部分基础岗位的招聘。
再到2018年到2020年两年间Transformer架构和Bert/GPT等语言模型的出现和演进,AI可以在无需标注或少量标注的情况下就可以获得很强的文本理解。这个能力对我们来说非常重要,因为猎头岗位的要求会非常多,理解要求并有可能需要多跳推理的场景。
所以我们从23年开始就开始打造我们人岗匹配系统的“地基”——HWE 语义模型。最早我们直接用开源模型,同时也作为我们训练对比的benchmark。
当时效果有是有,但是没达到预期。于是我们开始了HWE的迭代之路。
第一步,HWE0.1到0.2,我们拿了千万级的JD数据,在开源模型基础上做继续预训练,完成领域适应——先让模型“读懂”我们这个行业的语言。
第二步,HWE0.3到0.4,我们引入合成数据做对比学习,教模型分辨“什么是匹配、什么是不匹配”,拉近正例、推开负例。
第三步,HWE0.5,我们在训练时加了一个CNN投影层,专门放大那些稀缺但关键的技能信号。这一步非常关键,因为我们的JD里既有核心要求,又有哪些非核心要求。这一步就会让模型关注到那些关键技能的特征。就这一步,效果就提升了一倍。
但我们也发现,基于BGE这套encoder架构,天花板就到这了,因为基座模型的参数量就不够用了。
接着HWE 1.0,我们把基座模型直接换成了当时业界最强的Qwen3 Embedding 8B,基座一换,用同样的方法就把平均分再翻了一倍。
而我们最新的探索就是仿照Qwen3 Embedding的训练思路,训练了我们第一个“带推理”的Embedding模型。
它不再是简单地把文本压成一个向量,而是会先“思考”,再去理解JD和简历背后真正的匹配逻辑。目前这个模型还在验证中,但已经让我们看到了下一代匹配能力的方向。
未来我们也会持续深耕语义与推理匹配技术,不断打磨迭代,持续为平台的人岗匹配、猎头匹配业务提供更强的核心支撑。
下载Domi,精准人岗匹配↓
https://domi.hewa.cn/

