| 1234567891011121314151617181920212223242526272829303132333435363738394041424344 |
- #!/usr/bin/env python
- """
- 验证下载的数据集
- """
- from database.corpus import CorpusLoader
- def main():
- print("=" * 50)
- print("验证数据集")
- print("=" * 50)
- print()
- loader = CorpusLoader("database/corpus")
- domains = loader.list_available_domains()
- if not domains:
- print("未找到任何语料数据!")
- print("请先运行:python database/download_50_samples.py")
- return
- print(f"可用领域:{domains}")
- print()
- for domain in domains:
- texts = loader.load_texts(domain, limit=5)
- stats = loader.get_corpus_stats(domain)
- print(f"[{domain}]")
- print(f" 语料总数:{stats['num_texts']} 条")
- print(f" 平均长度:{stats['avg_chars']:.1f} 字符")
- print(f" 前 3 条预览:")
- for i, text in enumerate(texts[:3]):
- preview = text[:60] + "..." if len(text) > 60 else text
- print(f" [{i}] {preview}")
- print()
- print("=" * 50)
- print("验证完成!")
- print("=" * 50)
- if __name__ == "__main__":
- main()
|