国家自然科学基金(61229301) 作品数:11 被引量:102 H指数:6 相关作者: 吴信东 胡学钢 郭丹 武优西 王海平 更多>> 相关机构: 合肥工业大学 佛蒙特大学 河北工业大学 更多>> 发文基金: 国家自然科学基金 中国博士后科学基金 国家重点基础研究发展计划 更多>> 相关领域: 自动化与计算机技术 生物学 更多>>
结合主题分布与统计特征的关键词抽取方法 被引量:8 2017年 传统人工抽取关键词耗时耗力,为了能自动从文档中抽取出高质量的关键词,提出一种关键词自动抽取方法。该方法基于文档和词语的主题信息并结合词语的统计特征为候选词语打分,最终选择TopK得分的候选词作为文档关键词。实验结果表明,该方法在准确率、召回率以及F值上均优于现有的基本关键词抽取方法,能有效从文档中抽取出关键词。 刘啸剑 谢飞关键词:主题分布 关键词抽取 统计特征 主题信息 一种带有通配符和长度约束模式匹配问题的动态剪枝算法 被引量:1 2015年 近年来,随着生物信息学、信息检索等领域的发展,串模式匹配问题被不断扩展。其中,具有代表性的是在模式中引入可变长度的通配符而形成带有通配符的模式匹配(PMWL)。该问题定义的灵活性给用户提供了方便,却也造成了求解上的困难。因此,如何在多项式时间内得到更好的匹配解成为研究的焦点。提出了一种启发式的小兵算法。小兵算法通过将PMWL问题转化为路径搜索问题,并借鉴动态剪枝思想,在算法搜索的过程中动态地将不可能的匹配位置剪枝,从而提高解的质量。实验在真实DNA序列上进行,并人工生成了196个模式。结果表明,相比于目前最有效的SAIL算法,小兵算法在绝大多数的尾部有重复字符的模式中可以获得更好的匹配解。 王海平 戴玮 郭丹关键词:通配符 剪枝 基于通配符和长度约束的近似模式匹配算法 被引量:6 2013年 针对近似模式匹配算法在处理带有灵活通配符和长度约束近似模式匹配(APMWL)问题时只能解决替换操作,提出一种基于动态规划的编辑距离矩阵(EDM)构造方法,设计了基于EDM的近似模式匹配算法APM,可以处理近似匹配中的三种编辑操作,即插入、替换和删除操作。此外,根据文本中字符是否允许被重复使用的约束条件,设计APM-OF算法。实验结果表明,APM和APM-OF与同类算法相比具备显著的优势:与Sail_Approx匹配算法实验对比,获取解的平均增长率分别达到8.34%和12.37%;将APM-OF算法应用至模式挖掘中,挖掘出的频繁近似模式个数为OneoffMining算法的2.07倍。 黄国林 郭丹 胡学钢关键词:通配符 一般间隙及一次性条件的严格模式匹配 被引量:9 2015年 具有间隙约束的模式匹配是序列模式挖掘的关键问题之一.一次性条件约束是要求序列中每个位置的字符最多只能使用一次,在序列模式挖掘中采用一次性条件约束更加合理.但是目前,间隙约束多为非负间隙,非负间隙对字符串中每个字符的出现顺序具有严格的约束,一定程度上限定了匹配的灵活性.为此,提出了一般间隙及一次性条件的严格模式匹配问题;之后,理论证明了该问题的计算复杂性为NP-Hard问题.为了对该问题进行有效求解,在网树结构上构建了动态更新结点信息的启发式求解算法(dynamically changing node property,简称DCNP).该算法动态地更新各个结点的树根路径数、叶子路径数和树根-叶子路径数等,进而每次可以获得一个较优的出现;之后,迭代这一过程.为了有效地提高DCNP算法速度,避免动态更新大量的结点信息,提出了Checking机制,使得DCNP算法仅在可能产生内部重复出现的时候才进行动态更新.理论分析了DCNP算法的时间复杂度和空间复杂度.大量实验结果验证了DCNP算法具有良好的求解性能. 柴欣 贾晓菲 武优西 江贺 吴信东子网树求解一般间隙和长度约束严格模式匹配 被引量:14 2013年 具有通配符间隙约束的模式匹配问题在信息检索、计算生物学和序列模式挖掘等研究领域有重要的应用.提出了更一般性的模式匹配问题,即一般间隙和长度约束的严格模式匹配(strict pattern matching with general gaps and length constraints,简称SPANGLO).该问题具有如下4个特点:它是一种严格的精确模式匹配;允许序列中任意位置的字符被多次使用;模式串中可以包含多个一般间隙;对出现的总体长度进行了约束.最坏情况下,一个SPANGLO实例将转换出指数个非负间隙的严格模式匹配实例.为了有效地解决该问题,提出了子网树及其相关概念和性质.在此基础上提出了求解算法SubnettreeSpanglo(SETS),并给出算法的正确性和完备性证明,同时指出该算法的空间复杂度与时间复杂度分别为O(m MaxLen W)和O(MaxLen W m2 n),其中,m,n,MaxLen和W分别是模式和序列的长度、出现的最大长度约束和模式的最大间距.实验结果既验证了SPANGLO问题转换方法的正确性,又验证了该算法的正确性和有效性. 武优西 刘亚伟 郭磊 吴信东带通配符的模式匹配问题及其解空间特征分析 被引量:1 2014年 随着生物信息学、信息检索等领域的发展,带有通配符和长度约束的模式匹配问题引起了广泛关注。该问题扩展了精确模式匹配问题,使匹配更加灵活,同时也增加了匹配的复杂性,极大地提高了非线性匹配算法的复杂度。求解该问题的匹配算法的效率与问题的解空间密切相关,而目前针对该问题的解空间及其特征尚缺乏系统的研究。鉴于此,描述了该问题的解空间,并分析了解空间的可分性。之后,提出解空间划分算法SPLIT,并分析了SPLIT的时间复杂性。实验部分以3个匹配算法为对照,在真实DNA数据集下,使用了5109组模式。实验结果表明,SPLIT不影响匹配解的结构,且可以有效降低非线性匹配算法的时间消耗。 项泰宁 郭丹 王海平 胡学钢关键词:解空间 通配符 基于属性值分类的多层次粗糙集模型 被引量:9 2013年 传统的粗糙集理论主要是针对单层次决策表的属性约简和决策规则获取研究.然而,现实中树型结构的属性值分类是普遍存在的.针对条件属性具有属性值分类的情况,结合全子树泛化模式,提出一种多层次粗糙集模型,分析决策表在不同层次泛化空间下相关性质.结合基于正区域的属性约简理论,提出属性值泛化约简概念讨论二者之间的关系,同时证明求解泛化约简是一个NP-Hard问题.为此,提出一种基于正区域的的启发式泛化约简算法,该算法采用自顶向下逐步细化搜索策略,能够在保持原始决策表正区域不改变的前提下,将决策表所有属性值泛化到最佳层次.理论分析和仿真实验表明,泛化约简方法能提高知识发现的层次和泛化能力. 叶明全 胡学钢 胡东辉 吴信东关键词:属性约简 字符分布特征对带有通配符串匹配问题的影响 2016年 近年来,字符串匹配问题被不断扩展。其中,具有代表性的是在模式中引入可变长度的通配符,称之为PMWL问题。针对此问题,已有工作分析了在不同的模式特征下,匹配数卵随文本长度增加呈指数级增长。同时考虑文本分布特征和模式特征,建立了期望模型E(Ω)=nDπ(P),其中n为文本长度,D为模式中各通配符跨度的乘积,π(P)为基于字符分布的模式出现概率。实验部分,在人工随机数据和DNA真实数据上验证了E(Ω)的准确性,得到预测误差率分别为1.8%-3.2%和4.7%~7.8%;在不同字符分布中,分析了模式模长和通配符跨度对匹配数n的影响。E(Ω)模型揭示了n的增长趋势不一定呈指数级,而取决于π(P)和D的共同影响,且E(Ω)模型能够在线性时间内得到近似完备解。 王海平 郭丹 项泰宁 胡学钢关键词:串匹配 通配符 带任意长度通配符的模式匹配 被引量:5 2014年 基因序列中,许多病毒并不是简单的直接复制自己,而是相邻字符间插入或者删除序列片段,如何从序列数据中检索这些病毒具有重要的研究价值.提出了一个更普遍的问题,带任意长度通配符的模式匹配问题(Pattern matching with arbitrary-length wildcards,PMAW),这里模式中不仅可以有多个通配符约束,而且每个通配符的约束可以是两个整数,也可以从整数到无穷大.给定序列S和带通配符的模式P,目标是从S中检索P的所有出现和每一次出现的匹配位置,并且要求任意两次出现不能共享序列中同一位置.为了有效地解决该问题,设计了两个基于位并行的匹配算法MOTW(Method of ocurrence then window)算法和MWTO(Method of window then ocurrence)算法.同时,MWTO算法进行细微改动就可以满足全局长度约束.实验结果既验证了算法求解问题的正确性,又验证了比相关的模式匹配算法具有更好的时间性能. 强继朋 谢飞 高隽 胡学钢 吴信东关键词:通配符 位并行 基因序列 周期性一般间隙约束的序列模式挖掘 被引量:12 2017年 序列模式挖掘是从给定序列中发现出现频率高的模式的一种方法,目前已在诸多领域被广泛应用.假定子模式p_i和p_j(i 武优西 周坤 刘靖宇 江贺 吴信东关键词:序列模式挖掘 APRIORI性质 人工智能