28 Oct 2022
一、背景 知識庫是企業經營過程中的麵向客戶和內部員工的知識沉澱文檔庫,裏麵包含各類教程、問答、案例等,知識庫的檢索匹配是自然語言處理(NLP)中一個重要的基礎問題,本質是進行文本語義的相似度計算,也就是語義匹配,我們很多領域的任務都可以抽象為文本匹配檢索任務,例如檢索引擎、智能客服、知識檢索、信息推薦等領域。 知識庫檢索匹配可以概述為:給定一個query和大量候選知識庫的文檔,從這些文檔中找出與用戶輸入query最匹配的TopK個文檔。 二、架構流程 2.1、整體架構 2.…
Read More
16 Sep 2022
一、背景 隨著數據倉庫的數據量的增長,數據血緣( Data Lineage or Data Provence ) 對於數據分析來說日益重要, 通過數據血緣可以追溯表-表,表-任務,任務-任務的上下遊關係, 用來支撐問題數據溯源,孤島數據下線的需求。 目前已經基於 ANTLR 語法解析支持了 SQL 任務的血緣解析, 而 Spark App 任務的血緣仍然是通過人工配置方式進行。 我們希望能夠將…
Read More
05 Sep 2022
一、有讚搜索平台整體設計 在介紹QP前先簡單介紹一下搜索平台的整體結構,方便大家快速了解QP在搜索平台中的作用。下圖簡單展示了一個搜索請求開始到結束的全部流程。業務通過簡潔的api接入los,管理員在搜索平台新建配置並下發,完成整個搜索接入,並通過abtest驗證QP帶來的優化效果。 二、QP的作用 在NLP中,QP被稱作Query理解(QueryParser),簡單來說就是從詞法、句法、語義三個層麵對query進行結構化解析。這裏query從廣義上來說涉及的任務比較多,最常見的就是搜索係統中輸入的查詢詞,也可以是FAQ問答或閱讀理解中的問句,又或者可以是人機對話中用戶的聊天輸入。…
Read More
05 Jul 2022
1. 對比學習的引入 一般做算法任務時,都需要搜集大量標注的數據,假如我們要預測一個商品的產品詞(中心詞),下麵是一個商品標題: 三亞亞龍灣玫瑰穀JESS玫瑰臻白顏透潤花瓣 免洗麵膜收縮毛孔 這個商品的產品詞就是“麵膜”,任務就是要把麵膜識別出來,看起來是個標準的NER任務,我們也確實使用了CRF和指針網絡之類的方法,對於上麵這種標題效果還不錯,但是由於SaaS商家的經營習慣不同於平台,很少依賴平台搜索流量,所以很多標題很簡短甚至不會包含產品詞,比如: 迪奧絲絨係列760 專屬女團色 藍調正紅 可鹽可甜 澳優能立多3段 對於這種問題,…
Read More
21 Jun 2022
一、 前言 模型部署作為算法工程落地的最後一公裏,其天然對算法團隊而言具有較高的複雜性,不僅要考慮如何高效地部署、管理不同框架模型,還需要考慮分布式服務的負載均衡、故障容錯、可擴展性、資源隔離、限流、核心指標監控等問題。 這些都極大的依賴於工程團隊的能力,不是算法團隊的強項,如何解決這最後一公裏,讓焦點聚焦在模型開發上,是模型部署服務模塊需要解決的問題。 二、 原有架構 2.1 架構設計 在有讚算法平台Sunfish包含算法訓練和模型部署兩部分, 模型部署的模塊稱為ABox(小盒子)…
Read More