hotfix batch: ctime/来源恢复/阅读时长/selector权重 + daily log完整版

This commit is contained in:
fxy
2026-06-16 21:15:02 +08:00
parent e5098d1b81
commit 48875e6c21
2 changed files with 68 additions and 20 deletions

View File

@ -165,3 +165,37 @@ NYT, CNN, Al Jazeera, TechCrunch, BBC, The Guardian, CNBC, Bloomberg
每轮 ~300条 每轮 ~300条
**中英文源合并后每轮:~500条 → RAW存档 → 精选80条** **中英文源合并后每轮:~500条 → RAW存档 → 精选80条**
### Hotfix Batch 2026-06-16-2 — 修复三项数据问题
#### ① 新浪头条published为空修复
- **问题**新浪API返回的`ctime`是字符串`"1781604459"`而非数字,代码中`isinstance(ctime, (int, float))`判定False
`published`字段全为空 → selector无时效加分 → 10条新浪头条全部落选中国热点只有新华网
- **修复**`local_fetch_cn.py``int(ctime)`转换字符串时间戳
- **效果**:新浪-头条10条全部入选精选池中国热点恢复正常
#### ② 新闻来源被AI改写修复
- **问题**summarize_news.py调用DeepSeek后AI把`新浪-头条`改写为`新浪财经`
- **修复**:新增`build_source_lookup()` + `restore_source()`AI输出后按标题匹配恢复原始来源名
- **效果**:中国热点中新浪头条正确显示为"新浪-头条",而非"新浪财经"
#### ③ 微信读书阅读时长单位错误修复
- **问题**WeRead API返回的`readingTime`单位是秒代码当作分钟处理15分钟读书记录显示为"15小时"
- **修复**`sync.py``read_seconds // 60`转分钟
- **效果**GitHub入门与实践30小时24分钟→30分钟Python编程471小时→7小时51分钟
#### ④ 时间显示格式修复
- **问题**:今日新闻在摘要中只显示`HH:MM`无日期前缀
- **修复**`summarize_news.py` → 始终输出`MM-DD HH:MM`格式
- **效果**:所有条目统一显示`06-16 10:07`,跨日可辨
#### ⑤ selector权重优化
- **问题**selector.py缺少新增非RSS源新浪、观察者网、人民网的权重主题上限固定3条导致国内热点被筛
- **修复**新增SOURCE_WEIGHTS条目新浪-头条1.3最高主题上限改为差异化配置中国热点主题放宽至2x
- **效果**:中文精选从单一新华网变为新浪+新华网+观察者网混合
**涉及文件:**
- local_fetch_cn.py — ctime类型修复
- selector.py — 新源权重 + 主题差异化上限
- summarize_news.py — 来源恢复逻辑 + 时间格式修复
- sync.py — 阅读时长秒→分钟

View File

@ -1,29 +1,43 @@
# 运维日志 2026-06-16 # 运维日志 2026-06-16(完整版)
## 今日核心变更 ## 一、新闻体系全面改造
### 1. 新闻+ RAW分层v0.4 ### 中文新闻源 v3.017:30
- 东京新增5源BBC, Guardian, CNBC, FT中文, Bloomberg 本地 local_fetch_cn.py 全面重写:
- 本地清理失效源,保留新华网+微博 - 移除所有国产RSS全线死亡
- 全量->RAW ndjson存档精选80条->AI摘要 - 新增5路非RSS抓取新浪API(40条)、新华网频道页(61条)、人民网栏目页(31条)、观察者网(50条)、微博(30条)
- 成果424条/轮 → RAW全存 + 80条精选 - 中文源合计 ~207条/轮
- token月费不变~¥20 - 全部自带日期标记URL提取/Api时间戳
### 2. 行情数据采集(新线 ### Hotfix Batch18:00~21:00
- fetch_market_daily.py 上线 - ctime字符串→int新浪发布时间修复
- 31品种日线指数10+汇率6+数字货币12+宏观3 - 来源AI改写修复build_source_lookup + restore_source
- 0 token消耗~200KB/年 - 阅读时长秒→分钟sync.py read_seconds // 60
- 时间格式统一 MM-DD HH:MM
- selector权重优化新浪头条1.3,主题上限差异化
### 国际源东京12源
NYT/CNN/BBC/Guardian/CNBC/Bloomberg/Al Jazeera/TechCrunch + 36氪/FT中文
每轮 ~296条
### 分层方案
501条/轮 → RAW全部存档 → selector精选80条 → AI摘要
## 二、行情采集系统上线
- fetch_market_daily.py — 31品种每日OHLCV
- 指数10 + 汇率6 + 数字货币12 + 宏观3
- 0 token消耗年增量<200KB
- crontab 50 23 * * * - crontab 50 23 * * *
### 3. 今日卡片产出 ## 三、今日卡片产出5篇
- 00: 正反馈飞轮_智能体协作模式 1. 00_正反馈飞轮_智能体协作模式
- 01: 项益鸣课程总结 2. 01_项益鸣课程总结
- 02: 个人数字体系全景 3. 02_个人数字体系全景
- 03: 素材积累与AI能力的辩证关系 4. 03_素材积累与AI能力的辩证关系
- 04: 行情数据采集方案_双轨归档 5. 04_行情数据采集方案_双轨归档
### 涉及仓库 ## 四、涉及仓库
- server-ops: CHANGELOG + daily log - server-ops: CHANGELOG + daily log
- daily-brief: fetch_market_daily.py, archive_daily_brief.py, raw/ (首次存档), market_data/ (首次31个CSV) - daily-brief: fetch_market_daily.py + archive_daily_brief.py + raw/ + market_data/
- inspiration-collector: 5篇卡片 - inspiration-collector: 5篇卡片
- Claw工作空间: 完整工作日志 - Claw工作空间: 完整工作日志