demo1.py 2.0 KB

12345678910111213141516171819202122232425262728293031323334353637383940414243444546474849505152535455565758596061626364656667686970717273747576777879808182838485
  1. #!/usr/bin/env python3
  2. # -*- encoding: utf-8 -*-
  3. # Copyright FunASR (https://github.com/FunAudioLLM/SenseVoice). All Rights Reserved.
  4. # MIT License (https://opensource.org/licenses/MIT)
  5. from funasr import AutoModel
  6. from funasr.utils.postprocess_utils import rich_transcription_postprocess
  7. model_dir = "iic/SenseVoiceSmall"
  8. model = AutoModel(
  9. model=model_dir,
  10. trust_remote_code=True,
  11. remote_code="./model.py",
  12. vad_model="fsmn-vad",
  13. vad_kwargs={"max_single_segment_time": 30000},
  14. device="cuda:0",
  15. )
  16. # en
  17. res = model.generate(
  18. input=f"{model.model_path}/example/en.mp3",
  19. cache={},
  20. language="auto", # "zh", "en", "yue", "ja", "ko", "nospeech"
  21. use_itn=True,
  22. batch_size_s=60,
  23. merge_vad=True, #
  24. merge_length_s=15,
  25. )
  26. text = rich_transcription_postprocess(res[0]["text"])
  27. print(text)
  28. # zh
  29. res = model.generate(
  30. input=f"{model.model_path}/example/zh.mp3",
  31. cache={},
  32. language="auto", # "zh", "en", "yue", "ja", "ko", "nospeech"
  33. use_itn=True,
  34. batch_size_s=60,
  35. merge_vad=True, #
  36. merge_length_s=15,
  37. )
  38. text = rich_transcription_postprocess(res[0]["text"])
  39. print(text)
  40. # yue
  41. res = model.generate(
  42. input=f"{model.model_path}/example/yue.mp3",
  43. cache={},
  44. language="auto", # "zh", "en", "yue", "ja", "ko", "nospeech"
  45. use_itn=True,
  46. batch_size_s=60,
  47. merge_vad=True, #
  48. merge_length_s=15,
  49. )
  50. text = rich_transcription_postprocess(res[0]["text"])
  51. print(text)
  52. # ja
  53. res = model.generate(
  54. input=f"{model.model_path}/example/ja.mp3",
  55. cache={},
  56. language="auto", # "zh", "en", "yue", "ja", "ko", "nospeech"
  57. use_itn=True,
  58. batch_size_s=60,
  59. merge_vad=True, #
  60. merge_length_s=15,
  61. )
  62. text = rich_transcription_postprocess(res[0]["text"])
  63. print(text)
  64. # ko
  65. res = model.generate(
  66. input=f"{model.model_path}/example/ko.mp3",
  67. cache={},
  68. language="auto", # "zh", "en", "yue", "ja", "ko", "nospeech"
  69. use_itn=True,
  70. batch_size_s=60,
  71. merge_vad=True, #
  72. merge_length_s=15,
  73. )
  74. text = rich_transcription_postprocess(res[0]["text"])
  75. print(text)