Commit Graph
5 Commits
Author SHA1 Message Date
sansenandClaude Code 4e68372518 日志改为摘要 + 有界预览:单次请求日志 6940KB → 2.8KB
/convert/start 原先 logger.info 直接 dump 整份结果(json.dumps(indent=2)):实测
1MB 输入 → 20188 条 → 6.9MB 日志,是原文的 15%,indent 还要再乘 1.4。转几份族谱
日志文件就会被撑爆。

改为:
- 一行摘要:输入字数、结果条数、类型分布、耗时(格式与 batch 接口的日志保持一致)
- 前 LOG_PREVIEW_ITEMS(=10) 条结果预览,体积有硬上界
- 新增 _result_summary() helper

类型分布一行能看出解析形态(如 {'干支纪年': 15624, '古代纪年': 147, ...}),
排查"整批变成未匹配"这类回归比翻全量结果还快。明细请用接口返回值。

验证:单次 1MB 请求日志 2.8KB(降 2428x);/convert/start、/convert/batch、
403 鉴权、空文本四条路径均正常;pytest 260 passed。

Co-Authored-By: Claude Code <noreply@anthropic.com>
2026-09-23 17:42:42 +08:00
sansenandClaude Code f4613a8da2 重命名 parser.py → era_parser.py:适配 Python 3.8.10 部署
`parser` 在 Python 3.8/3.9 是标准库内置模块(已弃用的旧语法解析器)。
BuiltinImporter 排在 sys.meta_path 第一位,优先于任何 sys.path 条目——
即使 sys.path[0] 指向项目根,`from parser import convert_text` 也会拿到内置
模块并抛 ImportError: cannot import name 'convert_text' from 'parser'
(unknown location)。该模块 3.9 弃用、3.10 才移除,故 3.8/3.9 部署环境都会中招。

- client_app.py: from parser import * → from era_parser import *
- era_data.py: 文档注释同步
- 纯重命名,无内容改动(git 识别为 100% similarity)

test/ 下的 extract.py / summary.py / test_parser.py 也已同步改导入,但 test/
被 .gitignore 忽略,不入库。CLAUDE.md / AGENTS.md 同样已更新(含「不要改回
parser.py」的警告),亦被忽略。

验证:pytest 257 passed;summary.py 96/96;语料回归 sample.txt 1766 条、
sample_2.txt 20188 条,与改名前完全一致。

Co-Authored-By: Claude Code <noreply@anthropic.com>
2026-09-23 16:56:45 +08:00
sansen 2f3830bd5d 增加批量接口,完善日期解析 2026-08-14 17:06:10 +08:00
sansen 7b790ef609 日志问题修改 2026-07-23 17:17:53 +08:00
sansen 5564a0ce77 修整部分问题,归纳年号别名到单独文件 2026-07-23 17:14:26 +08:00