# Vectorizing with word2vec/paragraphvectors

**URL:** <https://community.konduit.ai/t/vectorizing-with-word2vec-paragraphvectors/3361>\
**Category:** DL4J\
**Created:** [May 13, 2025, 12:16pm UTC](https://community.konduit.ai/t/vectorizing-with-word2vec-paragraphvectors/3361 "2025-05-13T12:16:55Z")\
**Posts on this page:** 6\
**Page:** 1

<div class="post-metadata">

**Author:** ![neyanog](https://avatars.discourse-cdn.com/v4/letter/n/839c29/32.png) [@neyanog](https://community.konduit.ai/u/neyanog)\
**Post date:** [May 13, 2025, 12:16pm UTC](https://community.konduit.ai/t/vectorizing-with-word2vec-paragraphvectors/3361/1 "2025-05-13T12:16:55Z")

</div>

I need to vectorize text for multi-label classification and for this I thought about using Mulan (from what I read DL4J does not do multi-label classification). Is it possible to do vectorization using word2vec or paragraphvectors? The necessary format would be something like: doc\_1, 0.01, 0.02, -0.12 …, x,y,z  
doc\_2, 0.03, -0.05, 0.14, x,y,z  
doc\_n …  
where x,y,z are the labels.

---

<div class="post-metadata">

**Author:** ![agibsonccc](https://yyz1.discourse-cdn.com/flex035/user_avatar/community.konduit.ai/agibsonccc/32/697_2.png) [@agibsonccc](https://community.konduit.ai/u/agibsonccc)\
**Post date:** [May 20, 2025, 12:23pm UTC](https://community.konduit.ai/t/vectorizing-with-word2vec-paragraphvectors/3361/2 "2025-05-20T12:23:04Z")

</div>

@neyanog each document would be an embedding. You can yes.

---

<div class="post-metadata">

**Author:** ![neyanog](https://avatars.discourse-cdn.com/v4/letter/n/839c29/32.png) [@neyanog](https://community.konduit.ai/u/neyanog)\
**Post date:** [May 30, 2025, 11:36am UTC](https://community.konduit.ai/t/vectorizing-with-word2vec-paragraphvectors/3361/3 "2025-05-30T11:36:33Z")

</div>

could i have a code example on how to do this?

---

<div class="post-metadata">

**Author:** ![agibsonccc](https://yyz1.discourse-cdn.com/flex035/user_avatar/community.konduit.ai/agibsonccc/32/697_2.png) [@agibsonccc](https://community.konduit.ai/u/agibsonccc)\
**Post date:** [June 17, 2025, 11:48am UTC](https://community.konduit.ai/t/vectorizing-with-word2vec-paragraphvectors/3361/4 "2025-06-17T11:48:37Z")

</div>

@neyanog just look in the examples. [deeplearning4j-examples/dl4j-examples/src/main/java/org/deeplearning4j/examples/advanced/modelling/embeddingsfromcorpus/paragraphvectors at master · deeplearning4j/deeplearning4j-examples · GitHub](https://github.com/deeplearning4j/deeplearning4j-examples/tree/master/dl4j-examples/src/main/java/org/deeplearning4j/examples/advanced/modelling/embeddingsfromcorpus/paragraphvectors)

---

<div class="post-metadata">

**Author:** ![neyanog](https://avatars.discourse-cdn.com/v4/letter/n/839c29/32.png) [@neyanog](https://community.konduit.ai/u/neyanog)\
**Post date:** [June 18, 2025, 5:51pm UTC](https://community.konduit.ai/t/vectorizing-with-word2vec-paragraphvectors/3361/5 "2025-06-18T17:51:08Z")

</div>

Please, it would be something like this? public static void main(String args) {

```
		String filePath = "myFilePath";
		FileDocumentIterator fileDocumentIterator = new FileDocumentIterator(filePath);
		TokenizerFactory tokenizerFactory = new DefaultTokenizerFactory();
		tokenizerFactory.setTokenPreProcessor(new CommonPreprocessor());
		Word2Vec vec = new Word2Vec.Builder()
		        .minWordFrequency(1)
		        .layerSize(2) 
		        .seed(42)
		        .windowSize(5)			        
		        .iterate(fileDocumentIterator)
		        .tokenizerFactory(tokenizerFactory)
		        //.epochs(10)
		        .build();

		vec.fit();
		
		InMemoryLookupTable<VocabWord> lookupTable = (InMemoryLookupTable<VocabWord>)vec.getLookupTable();
		WeightLookupTable weightLookupTable = vec.lookupTable();
		INDArray indArray = weightLookupTable.getWeights();

		long cols = indArray.shape()[1];

		List<double[]> vectorizedList = new ArrayList<>();
		for(int i = 0; i < cols; i++) {
			double[] col = indArray.getColumns(i).transpose().data().asDouble();
			
			vectorizedList.add(col);
			
			
		}
		double [] linha1 = vectorizedList.get(1);
		for(int i = 0; i <linha1.length;i++) {
			System.out.print(linha1[i] + " ");
		}

			
}

```

---

<div class="post-metadata">

**Author:** ![agibsonccc](https://yyz1.discourse-cdn.com/flex035/user_avatar/community.konduit.ai/agibsonccc/32/697_2.png) [@agibsonccc](https://community.konduit.ai/u/agibsonccc)\
**Post date:** [July 4, 2025, 9:58am UTC](https://community.konduit.ai/t/vectorizing-with-word2vec-paragraphvectors/3361/6 "2025-07-04T09:58:58Z")

</div>

@neyanog sorry ping me with an at next time. That looks ok.
