LLM充当OCR“纠错员”:如何选择最具性价比的API模型?
该贴探讨了在PDF表格OCR项目中,如何利用大语言模型(LLM)修正Azure OCR识别置信度低的问题。开发者对比了输入纯文本与截图对模型结果保守程度的影响,并分享了使用Gemini 2.5 Flash作为纠错模型的实践。这一案例反映了传...
标签索引
这个标签下有 2 篇文章。按时间回看相关判断与实践记录。
标签精选
该贴探讨了在PDF表格OCR项目中,如何利用大语言模型(LLM)修正Azure OCR识别置信度低的问题。开发者对比了输入纯文本与截图对模型结果保守程度的影响,并分享了使用Gemini 2.5 Flash作为纠错模型的实践。这一案例反映了传...
本文实测了通义千问编程版API的极致性价比。用户实付7.9元即可获得Lite套餐,包含18000次调用额度。该模型支持多模态交互及100万长上下文,参数规模近400B,处理速度约为100 tokens/s。实测表明,其在视觉理解和长文本分析...