hotfix batch: ctime/来源恢复/阅读时长/selector权重 + daily log完整版
This commit is contained in:
34
CHANGELOG.md
34
CHANGELOG.md
@ -165,3 +165,37 @@ NYT, CNN, Al Jazeera, TechCrunch, BBC, The Guardian, CNBC, Bloomberg
|
||||
每轮 ~300条
|
||||
|
||||
**中英文源合并后每轮:~500条 → RAW存档 → 精选80条**
|
||||
|
||||
### Hotfix Batch 2026-06-16-2 — 修复三项数据问题
|
||||
|
||||
#### ① 新浪头条published为空修复
|
||||
- **问题**:新浪API返回的`ctime`是字符串`"1781604459"`而非数字,代码中`isinstance(ctime, (int, float))`判定False,
|
||||
`published`字段全为空 → selector无时效加分 → 10条新浪头条全部落选,中国热点只有新华网
|
||||
- **修复**:`local_fetch_cn.py` → `int(ctime)`转换字符串时间戳
|
||||
- **效果**:新浪-头条10条全部入选精选池,中国热点恢复正常
|
||||
|
||||
#### ② 新闻来源被AI改写修复
|
||||
- **问题**:summarize_news.py调用DeepSeek后,AI把`新浪-头条`改写为`新浪财经`
|
||||
- **修复**:新增`build_source_lookup()` + `restore_source()`,AI输出后按标题匹配恢复原始来源名
|
||||
- **效果**:中国热点中新浪头条正确显示为"新浪-头条",而非"新浪财经"
|
||||
|
||||
#### ③ 微信读书阅读时长单位错误修复
|
||||
- **问题**:WeRead API返回的`readingTime`单位是秒,代码当作分钟处理,15分钟读书记录显示为"15小时"
|
||||
- **修复**:`sync.py` → `read_seconds // 60`转分钟
|
||||
- **效果**:GitHub入门与实践:30小时24分钟→30分钟;Python编程:471小时→7小时51分钟
|
||||
|
||||
#### ④ 时间显示格式修复
|
||||
- **问题**:今日新闻在摘要中只显示`HH:MM`无日期前缀
|
||||
- **修复**:`summarize_news.py` → 始终输出`MM-DD HH:MM`格式
|
||||
- **效果**:所有条目统一显示`06-16 10:07`,跨日可辨
|
||||
|
||||
#### ⑤ selector权重优化
|
||||
- **问题**:selector.py缺少新增非RSS源(新浪、观察者网、人民网)的权重,主题上限固定3条导致国内热点被筛
|
||||
- **修复**:新增SOURCE_WEIGHTS条目(新浪-头条1.3最高),主题上限改为差异化配置,中国热点主题放宽至2x
|
||||
- **效果**:中文精选从单一新华网变为新浪+新华网+观察者网混合
|
||||
|
||||
**涉及文件:**
|
||||
- local_fetch_cn.py — ctime类型修复
|
||||
- selector.py — 新源权重 + 主题差异化上限
|
||||
- summarize_news.py — 来源恢复逻辑 + 时间格式修复
|
||||
- sync.py — 阅读时长秒→分钟
|
||||
|
||||
@ -1,29 +1,43 @@
|
||||
# 运维日志 2026-06-16
|
||||
# 运维日志 2026-06-16(完整版)
|
||||
|
||||
## 今日核心变更
|
||||
## 一、新闻体系全面改造
|
||||
|
||||
### 1. 新闻扩源 + RAW分层(v0.4)
|
||||
- 东京新增5源:BBC, Guardian, CNBC, FT中文, Bloomberg
|
||||
- 本地清理失效源,保留新华网+微博
|
||||
- 全量->RAW ndjson存档,精选80条->AI摘要
|
||||
- 成果:424条/轮 → RAW全存 + 80条精选
|
||||
- token月费不变(~¥20)
|
||||
### 中文新闻源 v3.0(17:30)
|
||||
本地 local_fetch_cn.py 全面重写:
|
||||
- 移除所有国产RSS(全线死亡)
|
||||
- 新增5路非RSS抓取:新浪API(40条)、新华网频道页(61条)、人民网栏目页(31条)、观察者网(50条)、微博(30条)
|
||||
- 中文源合计 ~207条/轮
|
||||
- 全部自带日期标记(URL提取/Api时间戳)
|
||||
|
||||
### 2. 行情数据采集(新线)
|
||||
- fetch_market_daily.py 上线
|
||||
- 31品种日线:指数10+汇率6+数字货币12+宏观3
|
||||
- 0 token消耗,~200KB/年
|
||||
### Hotfix Batch(18:00~21:00)
|
||||
- ctime字符串→int(新浪发布时间修复)
|
||||
- 来源AI改写修复(build_source_lookup + restore_source)
|
||||
- 阅读时长秒→分钟(sync.py read_seconds // 60)
|
||||
- 时间格式统一 MM-DD HH:MM
|
||||
- selector权重优化:新浪头条1.3,主题上限差异化
|
||||
|
||||
### 国际源(东京12源)
|
||||
NYT/CNN/BBC/Guardian/CNBC/Bloomberg/Al Jazeera/TechCrunch + 36氪/FT中文
|
||||
每轮 ~296条
|
||||
|
||||
### 分层方案
|
||||
501条/轮 → RAW全部存档 → selector精选80条 → AI摘要
|
||||
|
||||
## 二、行情采集系统上线
|
||||
- fetch_market_daily.py — 31品种每日OHLCV
|
||||
- 指数10 + 汇率6 + 数字货币12 + 宏观3
|
||||
- 0 token消耗,年增量<200KB
|
||||
- crontab 50 23 * * *
|
||||
|
||||
### 3. 今日卡片产出
|
||||
- 00: 正反馈飞轮_智能体协作模式
|
||||
- 01: 项益鸣课程总结
|
||||
- 02: 个人数字体系全景
|
||||
- 03: 素材积累与AI能力的辩证关系
|
||||
- 04: 行情数据采集方案_双轨归档
|
||||
## 三、今日卡片产出(5篇)
|
||||
1. 00_正反馈飞轮_智能体协作模式
|
||||
2. 01_项益鸣课程总结
|
||||
3. 02_个人数字体系全景
|
||||
4. 03_素材积累与AI能力的辩证关系
|
||||
5. 04_行情数据采集方案_双轨归档
|
||||
|
||||
### 涉及仓库
|
||||
## 四、涉及仓库
|
||||
- server-ops: CHANGELOG + daily log
|
||||
- daily-brief: fetch_market_daily.py, archive_daily_brief.py, raw/ (首次存档), market_data/ (首次31个CSV)
|
||||
- daily-brief: fetch_market_daily.py + archive_daily_brief.py + raw/ + market_data/
|
||||
- inspiration-collector: 5篇卡片
|
||||
- Claw工作空间: 完整工作日志
|
||||
|
||||
Reference in New Issue
Block a user