忠实度评测泡沫戳破:AI模型“少说”反得高分,覆盖度成新标尺
一项研究揭示AI忠实度评估仅追求精确率,鼓励模型少说甚至不说…
一项研究揭示AI忠实度评估仅追求精确率,鼓励模型少说甚至不说…
Anthropic发布面向复杂代码开发的Claude Fab…
Hugging Face 博客发布面向语音智能体的代码切换语…
德国地方法院里程碑式裁决:谷歌AI Overviews生成的…
Anthropic推出Claude Fable 5(通用安全…
OpenAI正式为搜索API推出图像结果支持,打破此前仅返回…
DeepMind在塞拉利昂开展严格随机对照试验,首次在真实低…
Google DeepMind发布Gemma 4 12B多模…
AI视频工具Runway新增视频比例转换功能,支持一键将视频…
Google DeepMind发布Gemini 3.5 Li…
Anthropic即将发布Claude系列新模型Mythos…