sol/lucene на немецком

Ответить
Аватара пользователя
Гость

sol/lucene на немецком

Сообщение Гость »

я знаю, тут спецы по lucene есть
подскажите где можно творчески позаимствовать готовую к использованию конфигурацию solr для немецкого? я знаю что в природе есть словари от open office, списки стоп слов и т.д... не хочется велосипед изобретать...
Аватара пользователя
Гость

Re: sol/lucene на немецком

Сообщение Гость »

ну вот что то нашел, но думаю есть более детально...
http://www.typo3-media.com/blog/solr-no ... nsion.html" onclick="window.open(this.href);return false;

тексты в основном около-IT шные, может быть смешанная английско-немецкая терминология
Аватара пользователя
Гость

Re: sol/lucene на немецком

Сообщение Гость »

из разных источников было собрано что то вроде этого, ругайте.
"german-common-nouns.txt" был взят из статьи по ссылке и ничо так. но думаю если сгенерить из словаря то будет лучше. проблема только в том что в этот
файл должны попать только несоставные существительные, кажется в словаре такой информации нету...

Код: Выделить всё

    <fieldType name="text" class="solr.TextField" positionIncrementGap="100">
      <analyzer type="index">
        <tokenizer class="solr.WhitespaceTokenizerFactory"/>
	<filter class="solr.StopFilterFactory" 
		ignoreCase="true" 
		words="stopwords_de.txt" 
		enablePositionIncrements="true" 
	/>
	<filter class="solr.WordDelimiterFilterFactory" 
		generateWordParts="1" 
		generateNumberParts="1" 
		splitOnCaseChange="1" 
		splitOnNumerics="1"
		catenateWords="1" 
		catenateNumbers="1" 
		catenateAll="0" 
		preserveOriginal="1" 
	/>
	<filter class="solr.LowerCaseFilterFactory"/>

	<filter class="solr.DictionaryCompoundWordTokenFilterFactory" dictionary="german-common-nouns.txt"
		minWordSize="5" minSubwordSize="4" maxSubwordSize="15" onlyLongestMatch="true"/>
	<filter class="solr.RemoveDuplicatesTokenFilterFactory" />
	<filter class="solr.HunspellStemFilterFactory"
    		dictionary="de_DE_frami.dic"
    		affix="de_DE_frami.aff"
    		ignoreCase="true" 
	/>
	
      </analyzer>
      <analyzer type="query">
        <tokenizer class="solr.WhitespaceTokenizerFactory"/>
	<!--
        <filter class="solr.SynonymFilterFactory" synonyms="synonyms.txt" ignoreCase="true" expand="true"/>
	-->
	<filter class="solr.StopFilterFactory" 
		ignoreCase="true" 
		words="stopwords_de.txt" 
		enablePositionIncrements="true" 
	/>
	<filter class="solr.WordDelimiterFilterFactory" 
		generateWordParts="1" 
		generateNumberParts="1" 
		catenateWords="0" 
		catenateNumbers="0" 
		catenateAll="0" 
		splitOnCaseChange="1"
	/>
	<filter class="solr.LowerCaseFilterFactory"/>

	<filter class="solr.DictionaryCompoundWordTokenFilterFactory" dictionary="german-common-nouns.txt"
		minWordSize="5" minSubwordSize="4" maxSubwordSize="15" onlyLongestMatch="true"/>
	<filter class="solr.RemoveDuplicatesTokenFilterFactory" />
	<filter class="solr.HunspellStemFilterFactory"
    		dictionary="de_DE_frami.dic"
    		affix="de_DE_frami.aff"
    		ignoreCase="true" 
	/>
      </analyzer>
    </fieldType>
Аватара пользователя
Гость

Re: sol/lucene на немецком

Сообщение Гость »

и что, тут никто lucene не использует?!
Ответить