TextAnalysisServiceImpl.java 9.4 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241
  1. package com.njuzr.eaibackend.service.impl;
  2. import com.fasterxml.jackson.databind.JsonNode;
  3. import com.fasterxml.jackson.databind.ObjectMapper;
  4. import com.njuzr.eaibackend.mapper.StudentAssignmentMapper;
  5. import com.njuzr.eaibackend.po.TextAnalysis;
  6. import com.njuzr.eaibackend.service.TextAnalysisService;
  7. import edu.stanford.nlp.simple.Document;
  8. import edu.stanford.nlp.simple.Sentence;
  9. import lombok.extern.slf4j.Slf4j;
  10. import org.springframework.beans.factory.annotation.Autowired;
  11. import org.springframework.data.mongodb.core.MongoTemplate;
  12. import org.springframework.data.mongodb.core.query.Criteria;
  13. import org.springframework.data.mongodb.core.query.Query;
  14. import org.springframework.http.HttpEntity;
  15. import org.springframework.http.HttpHeaders;
  16. import org.springframework.http.HttpStatus;
  17. import org.springframework.http.MediaType;
  18. import org.springframework.http.ResponseEntity;
  19. import org.springframework.scheduling.annotation.Async;
  20. import org.springframework.stereotype.Service;
  21. import org.springframework.util.LinkedMultiValueMap;
  22. import org.springframework.util.MultiValueMap;
  23. import org.springframework.web.client.RestTemplate;
  24. import java.util.ArrayList;
  25. import java.util.List;
  26. /**
  27. * 文本分析服务实现类
  28. * 提供异步文本分析功能,包括分句、分词和词汇级别分析
  29. *
  30. * @author AI Assistant
  31. * @date 2025-01-27
  32. */
  33. @Slf4j
  34. @Service
  35. public class TextAnalysisServiceImpl implements TextAnalysisService {
  36. private final StudentAssignmentMapper studentAssignmentMapper;
  37. private final MongoTemplate mongoTemplate;
  38. private final ObjectMapper objectMapper;
  39. private final RestTemplate restTemplate;
  40. // 外部API配置
  41. private static final String WORD_LEVEL_API_URL = "https://laurenceanthony.net/software/wordfamilyfinder/get_result.php";
  42. private static final String DATABASE = "basewords_130.db";
  43. private static final String CORPUS = "bnc_freq";
  44. private static final int MAX_RETRY_COUNT = 5;
  45. private static final long RETRY_DELAY_MS = 500;
  46. @Autowired
  47. public TextAnalysisServiceImpl(StudentAssignmentMapper studentAssignmentMapper,
  48. MongoTemplate mongoTemplate) {
  49. this.studentAssignmentMapper = studentAssignmentMapper;
  50. this.mongoTemplate = mongoTemplate;
  51. this.objectMapper = new ObjectMapper();
  52. this.restTemplate = new RestTemplate();
  53. }
  54. /**
  55. * 异步分析并保存文本内容
  56. * 该方法会在后台异步执行,不会阻塞主流程
  57. *
  58. * @param studentId 学生ID
  59. * @param assignmentId 作业ID
  60. */
  61. @Async("textAnalysisTaskExecutor")
  62. @Override
  63. public void analyzeAndSaveTextContentAsync(Long studentId, Long assignmentId) {
  64. log.info("开始异步分析文本内容 - studentId: {}, assignmentId: {}", studentId, assignmentId);
  65. try {
  66. // 1. 获取最新的text_content
  67. String textContent = studentAssignmentMapper.getTextContent(studentId, assignmentId);
  68. if (textContent == null || textContent.trim().isEmpty()) {
  69. log.warn("文本内容为空,跳过分析 - studentId: {}, assignmentId: {}", studentId, assignmentId);
  70. return;
  71. }
  72. log.info("获取到文本内容,长度: {} - studentId: {}, assignmentId: {}",
  73. textContent.length(), studentId, assignmentId);
  74. // 2. 使用Stanford CoreNLP进行分句和分词
  75. Document doc = new Document(textContent);
  76. List<Sentence> allSentences = new ArrayList<>(doc.sentences()); // 一次性加载所有句子到内存
  77. // 后续操作都使用allSentences集合,避免频繁调用doc.sentences()方法
  78. List<String> sentences = allSentences.stream()
  79. .map(Sentence::text)
  80. .toList();
  81. log.info("分句完成,共{}个句子 - studentId: {}, assignmentId: {}",
  82. sentences.size(), studentId, assignmentId);
  83. // 3. 分词并获取词汇级别
  84. List<TextAnalysis.WordLevel> wordLevels = new ArrayList<>();
  85. for (Sentence sentence : allSentences) {
  86. for (String word : sentence.words()) {
  87. TextAnalysis.WordLevel wordLevel = new TextAnalysis.WordLevel();
  88. wordLevel.setWord(word);
  89. // 判断是否为标点符号
  90. if (isPunctuation(word)) {
  91. wordLevel.setBasewordLevel(0);
  92. } else {
  93. // 获取词汇级别(带重试机制)
  94. Integer level = fetchBasewordLevelWithRetry(word);
  95. wordLevel.setBasewordLevel(level);
  96. }
  97. wordLevels.add(wordLevel);
  98. }
  99. }
  100. log.info("分词完成,共{}个词汇 - studentId: {}, assignmentId: {}",
  101. wordLevels.size(), studentId, assignmentId);
  102. // 4. 组装TextAnalysis对象
  103. TextAnalysis analysis = new TextAnalysis();
  104. analysis.setStudentId(studentId);
  105. analysis.setAssignmentId(assignmentId);
  106. analysis.setTextContent(textContent);
  107. analysis.setSentences(sentences);
  108. analysis.setWordLevels(wordLevels);
  109. // 查找是否已有数据,若有则复用_id,实现数据的更新;若没有,则新插入
  110. Query query = new Query();
  111. query.addCriteria(Criteria.where("studentId").is(studentId).and("assignmentId").is(assignmentId));
  112. TextAnalysis old = mongoTemplate.findOne(query, TextAnalysis.class, "textAnalyses");
  113. if (old != null) {
  114. analysis.setId(old.getId());
  115. }
  116. // 5. 保存到MongoDB
  117. mongoTemplate.save(analysis, "textAnalyses");
  118. log.info("文本分析完成并保存到MongoDB - studentId: {}, assignmentId: {}",
  119. studentId, assignmentId);
  120. } catch (Exception e) {
  121. log.error("文本分析失败 - studentId: {}, assignmentId: {}, error: {}",
  122. studentId, assignmentId, e.getMessage(), e);
  123. }
  124. }
  125. /**
  126. * 判断字符串是否为标点符号
  127. *
  128. * @param word 待判断的字符串
  129. * @return 是否为标点符号
  130. */
  131. private boolean isPunctuation(String word) {
  132. return word.matches("\\p{Punct}");
  133. }
  134. /**
  135. * 带重试机制的词汇级别获取
  136. *
  137. * @param word 待查询的词汇
  138. * @return 词汇级别,如果查询失败返回0
  139. */
  140. private Integer fetchBasewordLevelWithRetry(String word) {
  141. for (int retry = 0; retry < MAX_RETRY_COUNT; retry++) {
  142. try {
  143. Integer level = fetchBasewordLevel(word);
  144. if (level != null) {
  145. return level;
  146. }
  147. } catch (Exception e) {
  148. log.warn("获取词汇级别失败,第{}次重试 - word: {}, error: {}",
  149. retry + 1, word, e.getMessage());
  150. }
  151. // 重试前等待
  152. if (retry < MAX_RETRY_COUNT - 1) {
  153. try {
  154. Thread.sleep(RETRY_DELAY_MS);
  155. } catch (InterruptedException e) {
  156. Thread.currentThread().interrupt();
  157. break;
  158. }
  159. }
  160. }
  161. log.warn("获取词汇级别失败,已达到最大重试次数 - word: {}", word);
  162. return 0;
  163. }
  164. /**
  165. * 调用外部API获取词汇级别
  166. *
  167. * @param word 待查询的词汇
  168. * @return 词汇级别,如果查询失败返回null
  169. */
  170. private Integer fetchBasewordLevel(String word) {
  171. try {
  172. // 设置请求头
  173. HttpHeaders headers = new HttpHeaders();
  174. headers.setContentType(MediaType.APPLICATION_FORM_URLENCODED);
  175. // 设置请求参数
  176. MultiValueMap<String, String> params = new LinkedMultiValueMap<>();
  177. params.add("search", word);
  178. params.add("database", DATABASE);
  179. params.add("corpus", CORPUS);
  180. HttpEntity<MultiValueMap<String, String>> request = new HttpEntity<>(params, headers);
  181. // 发送POST请求
  182. ResponseEntity<String> response = restTemplate.postForEntity(
  183. WORD_LEVEL_API_URL, request, String.class);
  184. if (response.getStatusCode() == HttpStatus.OK && response.getBody() != null) {
  185. // 解析JSON响应
  186. JsonNode jsonNode = objectMapper.readTree(response.getBody());
  187. // 检查响应格式:[[VALUE, level, ...]]
  188. if (jsonNode.isArray() && jsonNode.size() > 0) {
  189. JsonNode firstElement = jsonNode.get(0);
  190. if (firstElement.isArray() && firstElement.size() > 1) {
  191. JsonNode levelNode = firstElement.get(1);
  192. try {
  193. return levelNode.asInt(); // 直接返回整数
  194. } catch (NumberFormatException e) {
  195. log.warn("level不是有效数字: {}", levelNode);
  196. return 0;
  197. }
  198. }
  199. }
  200. }
  201. log.warn("API响应格式异常 - word: {}, response: {}", word, response.getBody());
  202. return 0;
  203. } catch (Exception e) {
  204. log.error("调用词汇级别API失败 - word: {}, error: {}", word, e.getMessage());
  205. return 0;
  206. }
  207. }
  208. }