此应用程序的某些内容目前无法使用。
如果这种情况持续存在,请联系我们反馈与联系
1. (WO2017040663) CREATING A TRAINING DATA SET BASED ON UNLABELED TEXTUAL DATA
国际局存档的最新著录项目数据   

公布号: WO/2017/040663 国际申请号: PCT/US2016/049700
公布日: 09.03.2017 国际申请日: 31.08.2016
国际专利分类:
G06F 7/00 (2006.01)
G PHYSICS
06
计算;推算;计数
F
电数字数据处理
7
通过待处理的数据的指令或内容进行运算的数据处理的方法或装置
申请人:
SKYTREE, INC. [US/US]; 1731 Technology Dr., Suite 700 San Jose, CA 95110, US
发明人:
PENDAR, Nick; US
WANG, Zhuang; US
代理人:
HOLMES, Matthew; US
GARNER, Casey; US
BOHN, Michael; US
NORSETH, Peter; US
ALSBURY, Paige; US
优先权数据:
62/213,09101.09.2015US
标题 (EN) CREATING A TRAINING DATA SET BASED ON UNLABELED TEXTUAL DATA
(FR) CRÉATION D'UN ENSEMBLE DE DONNÉES D'APPRENTISSAGE BASÉ SUR DES DONNÉES TEXTUELLES NON ÉTIQUETÉES
摘要:
(EN) A system and method are disclosed for obtaining a plurality of unlabeled text documents; obtaining an initial concept; obtaining keywords from a knowledge source based on the initial concept; scoring the plurality of unlabeled documents based at least in part on the initial keywords; determining a categorization of the documents based on the scores; performing a first feature selection and creating a first vector space representation of each document in a first category and a second category, the first and second categories based on the scores, the first vector space representation serving as one or more labels for an associated unlabeled textual document; and generating the training set including a subset of the obtained unlabeled textual documents, the subset of the obtained unlabeled documents including a documents belonging to the first category and documents belonging to the second category.
(FR) La présente invention concerne un système et un procédé destinés à obtenir une pluralité de documents texte non étiquetés; obtenir un concept initial; obtenir des mots-clés à partir d'une source de connaissances sur la base du concept initial; noter la pluralité de documents non étiquetés sur la base au moins en partie des mots-clés initiaux; déterminer une catégorisation des documents sur la base des notes; effectuer une première sélection de caractéristiques et créer une première représentation d'espace vectoriel de chaque document dans une première catégorie et dans une seconde catégorie, les première et seconde catégories étant basées sur les notes, la première représentation d'espace vectoriel servant comme une ou plusieurs étiquettes pour un document texte non étiqueté associé; et produire l'ensemble d'apprentissage comprenant un sous-ensemble des documents texte non étiquetés obtenus, le sous-ensemble des documents non étiquetés obtenus comprenant un document appartenant à la première catégorie et des documents appartenant à la seconde catégorie.
front page image
指定国: AE, AG, AL, AM, AO, AT, AU, AZ, BA, BB, BG, BH, BN, BR, BW, BY, BZ, CA, CH, CL, CN, CO, CR, CU, CZ, DE, DK, DM, DO, DZ, EC, EE, EG, ES, FI, GB, GD, GE, GH, GM, GT, HN, HR, HU, ID, IL, IN, IR, IS, JP, KE, KG, KN, KP, KR, KZ, LA, LC, LK, LR, LS, LU, LY, MA, MD, ME, MG, MK, MN, MW, MX, MY, MZ, NA, NG, NI, NO, NZ, OM, PA, PE, PG, PH, PL, PT, QA, RO, RS, RU, RW, SA, SC, SD, SE, SG, SK, SL, SM, ST, SV, SY, TH, TJ, TM, TN, TR, TT, TZ, UA, UG, US, UZ, VC, VN, ZA, ZM, ZW
非洲地区知识产权组织 (ARIPO) (BW, GH, GM, KE, LR, LS, MW, MZ, NA, RW, SD, SL, ST, SZ, TZ, UG, ZM, ZW)
欧亚专利局 (AM, AZ, BY, KG, KZ, RU, TJ, TM)
欧洲专利局 (AL, AT, BE, BG, CH, CY, CZ, DE, DK, EE, ES, FI, FR, GB, GR, HR, HU, IE, IS, IT, LT, LU, LV, MC, MK, MT, NL, NO, PL, PT, RO, RS, SE, SI, SK, SM, TR)
非洲知识产权组织 (OAPI) (BF, BJ, CF, CG, CI, CM, GA, GN, GQ, GW, KM, ML, MR, NE, SN, TD, TG)
公布语言: 英语 (EN)
申请语言: 英语 (EN)